spark性能优化(一)
来源:互联网 发布:苹果软件定制 编辑:程序博客网 时间:2024/05/22 11:57
性能优化概述:
(随着自己学习,持续更新,让博客见证我的成长之路吧)
spark计算本质基于内存,真正使用过的人,肯定遇到各种各样的性能问题,各种OOM;spark性能瓶颈很多:cpu、网络带宽、或者是内存等
数据量太大,内存放不下所有数据,需要对内存进行优化,比如使用些手段减少内存的消耗;内存容量足够放所有数据,网络传输和通信就会导致性能出现瓶颈……
经常遇到oom、文件丢失、task lost、内存异常各种问题,性能优化可以说是spark使用者必须掌握的,为避免自己成为,只会写spark程序不清楚内核原理,不会调优的spark逗比,默默总结下spark性能优化的主要手段:
1,使用高性能序列化类库
2,优化数据结构
3,对多次使用的RDD进行持久化/Checkpoint
4,使用序列化的持久化级别
5,java虚拟机垃圾回收调优
6,提高并行度
7,广播共享数据
8,数据本地化
9,reduceByKey 和groupByKey的合理使用
10,Shuffle调优
spark最大的优点,其实也是最大的问题--基于内存的计算模型。使用了基于内存的计算模型,导致稳定性不如hadoop。随着spark版本不断的更新,spark的稳定性也有了很大的提升,目前spark已更新到了2.1版本,增加了很多新的功能,很值得去尝试。
0 0
- spark性能优化(一)
- spark性能优化一
- spark性能优化指南(一)
- Spark性能优化指南(一)(开发调优)
- 一、Spark性能优化:开发调优篇
- (干货):Spark性能优化
- spark性能优化指南(二)
- Spark性能优化(1)
- Spark性能优化(1)
- Spark性能优化(2)
- Spark性能优化(3)
- Spark SQL性能优化
- Spark应用性能优化
- Spark性能优化2
- spark性能优化1
- spark的性能优化
- Spark性能优化总结
- Spark性能优化总结
- 安卓开发——Intent能传递的数据类型
- C++ 快速排序算法的实现与改进(含笔试面试题)
- 给定入栈顺序求所有出栈可能性
- 睿城_技术01----StampGIS IE10/11、win8.1/10访问三维球解决
- listview adapter 控件注册点击事件,点击一个item后有其他item的这个控件响应了事件
- spark性能优化(一)
- 深入学习ConcurrentHashMap
- 0325-表单标签-笔记
- php开源项目大全
- 百度地图能否获取第三方GPS数据
- 《Java高并发程序设计》学习 --5.10 网络NIO
- Android 手机屏幕熄灭,传感器会失效
- 输出倒三角形
- 请问Android如何在拍摄相片时获得地理位置