基于mdrill的大数据分析
来源:互联网 发布:淘宝虚拟充值平台 编辑:程序博客网 时间:2024/04/27 12:57
数据越来越多,传统的关系型数据库支撑不了,分布式数据仓库又非常贵。几十亿、几百亿、甚至几千亿的数据量,如何才能高效的分析?
mdrill是由阿里妈妈开源的一套数据的软件,针对TB级数据量,能够仅用10台机器,达到秒级响应,数据能实时导入,可以对任意的维度进行组合与过滤。
mdrill作为数据在线分析处理软件,可以在几秒到几十秒的时间,分析百亿级别的任意组合维度的数据。
在阿里10台机器完成每日30亿的数据存储,其中10亿为实时的数据导入,20亿为离线导入。目前集群的总存储3200多亿80~400维度的数据。
mdrill是由阿里妈妈开源的一套数据的软件,针对TB级数据量,能够仅用10台机器,达到秒级响应,数据能实时导入,可以对任意的维度进行组合与过滤。
mdrill作为数据在线分析处理软件,可以在几秒到几十秒的时间,分析百亿级别的任意组合维度的数据。
在阿里10台机器完成每日30亿的数据存储,其中10亿为实时的数据导入,20亿为离线导入。目前集群的总存储3200多亿80~400维度的数据。
mdrill的特性
1.满足大数据查询需求:adhoc每天的数据量为30亿条,随着日积月累,数据会越来越大,mdrill采用列存储,索引,分布式技术,适当的分区等满足用户对数据的实时在线分析的需求。
2.支持增量更新:离线形式的mdrill数据支持按照分区方式的增量更新。
3.支持实时数据导入:在仅有10台机器的情况下,支持每天10亿级别(高峰每小时2亿)的实时导入。
5.低成本:目前在阿里adhoc仅仅使用10台48G内存的PC机,但确存储了超过千亿规模的数据。
6.全文检索模式:在mdrill的全文检索模式数据可以直接存储在hdfs中,并且以每天160亿*70维度的数据增量提供全文检索服务(注:该模式下不能进行统计,只能进行关键词匹配查询数据明细)
mdrill的定位
大数据
要数据量大,几十亿上百亿。
还要省钱,普通PC就能搞定。
多维分析
要任意维度组合与过滤
还要对任意指标进行统计和排序
即席查询
要查询快,秒级响应。
还要数据快,数据分钟级延迟。
资源列表
- mdrill介绍
- mdrill介绍PPT
- 安装部署
- sql使用手册
- 版本开发计划
- 阿里妈妈-AdHoc-基于mdrill的大数据自助分析平台
其他
- 官方地址:https://github.com/alibaba/mdrill
- mdrill技术交流群:171465049
- 微博:http://weibo.com/mynyannian
0 0
- 基于mdrill的大数据分析
- 基于mdrill的大数据分析
- 基于大数据的中文舆情分析
- 基于大数据的房价分析
- 大数据分析- 基于Hadoop/Mahout的大数据挖掘
- 大数据分析- 基于Hadoop/Mahout的大数据挖掘
- 大数据分析- 基于Hadoop/Mahout的大数据挖掘
- 大数据分析- 基于Hadoop/Mahout的大数据挖掘
- 大数据分析- 基于Hadoop/Mahout的大数据挖掘
- 基于大数据的房价分析--1.数据爬取
- 基于大数据的房价分析--2.数据解析
- 基于Hadoop大数据分析
- 基于大数据的银行反欺诈的分析报告
- 基于HBase的大数据存储的应用场景分析
- 基于HBase的大数据存储的应用场景分析
- 基于HBase的大数据存储的应用场景分析
- 比谷歌手表更酷!基于大数据分析的睡衣
- 基于常规法则的大数据分析最佳实践
- Unity3D游戏开发称网游流行的第三人模式
- PHP/THINKPHP创建优惠券码
- 自动广播台配置攻略
- 发送json数据给服务器以及多值参数
- js中yyyy-mm-dd hh:mm 比较时间大小
- 基于mdrill的大数据分析
- solr-搜索-层面分析
- CentOS设置程序开机自启动的方法
- 常用的Java文件操作
- 如何写一个爆掉内存的PHP程序
- android标题栏的选择与使用,AppCompatActivity!
- 中英文维基百科语料上的Word2Vec实验
- 数据缓存
- 总结弹弹2.0版本的历程