spark集群部署-硬件配置官方建议
来源:互联网 发布:宁波cnc编程招聘 编辑:程序博客网 时间:2024/05/19 14:17
1、存储系统
因为spark job需要从外部的存储系统(或文件系统)读取数据(例如:hbase、hdfs等),所有让spark任务尽可能的接近数据本地,让spark和hadoop部署到相同的节点上;数据本地性:将计算任务推送到数据所在地,如果不能保证,也要尽可能的让计算任务接近数据所在地;
2、磁盘
spark虽然是内存计算,但当数据在内存中无法容下或数据需要持久化时,还是需要数据写入本地磁盘,所以磁盘的配置也是很重要的;官方建议,每个节点挂载4-8个磁盘,并且磁盘设置noatime;
3、内存
官方建议每个work配置8g内存,配置太多的内存,JVM的full gc时间会越长,stop the world时间越长;如果机器的配置比较高端,比如内存256g,在其他因素(cpu等)允许的情况下,可以考虑在一个节点上跑多个work进程
4、网络
网络越快越好
5、CPU核数
spark官方建议,每一个节点至少有8-16 cores,当数据已经在内存中后,影响计算性能的因素就剩下网络和cpu了
阅读全文
0 0
- spark集群部署-硬件配置官方建议
- spark集群部署-硬件配置官方建议
- Spark集群硬件配置
- 《Spark 官方文档》硬件配置
- 《Spark 官方文档》硬件配置
- Spark集群硬件配置参考
- Spark集群硬件挑选
- Hadoop2.2集群安装配置-Spark集群安装部署
- spark配置:spark集群
- Spark集群部署
- Spark集群部署
- Spark集群部署
- spark部署standalone集群
- spark部署yarn集群
- Spark集群部署
- Spark集群安装部署
- spark集群部署
- Spark集群安装部署
- ue4 中的事件分配器(事件调度器)
- 基于netflow的网络攻击分析与检测
- Python常用函数记录
- C# picturebox循环显示图片
- .net知识集合
- spark集群部署-硬件配置官方建议
- 判断字符串中是否含有某些字段
- linux主从复制
- 2017年 计算机辅助设计与图形学大会 CAD&CG
- Mysql的存储引擎,myisam和innodb的区别
- mysql 主键冲突更新
- 光模块
- Java Servlet 工作原理
- 详解Eclipse之重构(Refactor)