分布式计算开源框架Hadoop学习心得2

来源:互联网 发布:淘宝商家资质中心 编辑:程序博客网 时间:2024/04/30 14:52

之前一篇,写了不少东西,结果发出来的时候才一点点。。。杯具了,现在只能继续加上去了

----------------------------------------------------HLL的分割线--------------------------------------------------------------------

 

    任务分解处理以后,那就需要将处理以后的结果再汇总起来,这就是Reduce要做的工作。

1MapReduce结构示意图

上图就是MapReduce大致的结构图,在Map前还可能会对输入的数据有Split(分割)的过程,保证任务并行效率,在Map之后还会有Shuffle(混合)的过程,对于提高Reduce的效率以及减小数据传输的压力有很大的帮助。后面会具体提及这些部分的细节。

HDFS是分布式计算的存储基石,Hadoop的分布式文件系统和其他分布式文件系统有很多类似的特质。分布式文件系统基本的几个特点:

  1. 对于整个集群有单一的命名空间。
  2. 数据一致性。适合一次写入多次读取的模型,客户端在文件没有被成功创建之前无法看到文件存在。
  3. 文件会被分割成多个文件块,每个文件块被分配存储到数据节点上,而且根据配置会由复制文件块来保证数据的安全性。

原创粉丝点击