预备工作——数据处理流程
来源:互联网 发布:淘宝讲师 编辑:程序博客网 时间:2024/06/05 20:07
该项目是一个纯粹的数据分析项目,其整体流程基本上就是依据数据的处理流程进行,依此有以下几个大的步骤:
1) 数据采集
首先,通过页面嵌入JS代码的方式获取用户访问行为,并发送到web服务的后台记录日志
然后,将各服务器上生成的点击流日志通过实时或批量的方式汇聚到HDFS文件系统中
当然,一个综合分析系统,数据源可能不仅包含点击流数据,还有数据库中的业务数据(如用户信息、商品信息、订单信息等)及对分析有益的外部数据。
2) 数据预处理
通过mapreduce程序对采集到的点击流数据进行预处理,比如清洗,格式整理,滤除脏数据等
3) 数据入库
将预处理之后的数据导入到HIVE仓库中相应的库和表中
4) 数据分析
项目的核心内容,即根据需求开发ETL分析语句,得出各种统计结果
5) 数据展现
将分析所得数据进行可视化
阅读全文
0 0
- 预备工作——数据处理流程
- 工作一周+文章预备
- 实验预备工作
- 【Struts】——工作流程
- J2SE习题—预备知识
- 数据处理流程
- 数据处理流程
- 数据处理流程
- 调试MBR的预备工作
- openGL第五讲——工作流程
- openGL第五讲——工作流程
- 目标3——框架工作流程
- Fixflow工作流程——介绍
- 工作日志——行为流程
- 数据库—服务器的工作流程
- 编码之旅——预备篇
- 汇编语言基础一 —— 预备知识
- 文件系统预备——磁盘管理
- Redis 集成Spring(spring-data-redis)
- 解决VMWare 14 pro 启动出现mks 套接字次数太多的问题
- 每天一个linux命令(33):df 命令
- leetcode 399. Evaluate Division 并查集+图的广搜
- 日记★DP★G-字串距离
- 预备工作——数据处理流程
- Spring核心接口之Ordered
- 每天一个linux命令(34):du 命令
- HashSet 的实现原理
- 计数循环的控制
- 模拟实现 memcpy memmove 函数
- leetCode-Search a 2D Matrix
- 每天一个linux命令(35):ln 命令
- Postman使用技巧之三:用Postman生成Request代码