Spark中的一些概念

来源:互联网 发布:酷家乐装修设计软件 编辑:程序博客网 时间:2024/06/05 11:34

一次action操作会触发RDD的延迟计算,我们把这样的一次计算称作一个Job。

窄依赖指的是:每个parent RDD 的 partition 最多被 child RDD的一个partition使用
宽依赖指的是:每个parent RDD 的 partition 被多个 child RDD的partition使用
窄依赖每个child RDD 的partition的生成操作都是可以并行的,而宽依赖则需要所有的parent partition shuffle结果得到后再进行。

原创粉丝点击