001-spark生态系统介绍
来源:互联网 发布:编写软件程序步骤 编辑:程序博客网 时间:2024/05/16 11:26
1、Spark简介-概念
Spark是基于内存计算的大数据分布式计算框架。Spark基于内存计算,提高了在大数据环境下数据处理的实时性,同时保证了高容错性和高可伸缩性,允许用户将Spark部署在大量廉价硬件之上,形成集群。
主要特点:
分布式计算
内存计算
容错
多计算范式
Spark于2009 年诞生于加州大学伯克利分销AMPLab。目前,已经成为Apache软件基金会旗下顶级开源项目。
在“One Stack to rule them all”思想的引领下,Spark成功的使用Spark SQL、Spark Streaming、MLLib、GraphX近乎完美的解决了大数据中Batch Processing、Streaming Processing、Ad-hoc Query等三大核心问题。
2、Spark简介-历史
2009年:Spark诞生于AMPLab
2010年:开源
2013年6月:Apache孵化器项目
2014年2月:Apache顶级项目
Now:Contribututors>450人
3、Spark简介-BDAS生态系统
3.1 BDAS(the Berkeley Data Analytics Stack) 伯克利数据分析栈
3.2 Spark Ecosystem
Spark成功的使用Spark SQL、Spark Streaming、MLLib、GraphX近乎完美的解决了大数据中Batch Processing、Streaming Processing、Ad-hoc Query等三大核心问题,更为美妙的是在Spark中Spark SQL、Spark Streaming、MLLib、GraphX四大子框架和库之间可以无缝的共享数据和操作。
0 1
- 001-spark生态系统介绍
- Spark生态系统项目
- <转>Spark 生态系统组件
- Spark 生态系统组件
- 大数据生态系统基础:Apache Spark(一):介绍和编译、安装
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Hadoop生态系统介绍
- Spark入门到精通视频学习资料--第二章:Spark生态系统介绍,Spark整体概述与Spark编程模型(2讲)
- hadoop生态系统的详细介绍
- Hadoop最全生态系统介绍
- DesignPattern_Java:Bridge Pattern
- #1224 : 赛车
- Invalid file name: must contain only[a-z0-9_.]
- 如果要设计一个网络爬虫程序,该怎么避免陷入无限循环
- Hadoop学习笔记(十八)---Hive内部表,外部表,分区表,桶表
- 001-spark生态系统介绍
- c++的头文件
- PCA
- Kmeans和GMM参数学习的EM算法原理和Matlab实现
- UVA 1149 水题
- Java性能优化(7):改写equals时遵守通用约定
- 利用散列函数进行字符串匹配
- Activiti错误结束事件入门实例
- 轻松python之文件专题-读取文件专题