基于 Spark on Hive 的离线数据分析,将应用市场的日志数据和业务数据通过Flume 导入 Kafka,使用 Java API 消费 Kafka 中的数据,写入 HBase,利用 Spark 并进行统一分析和计算,最后将所得到的结果存入 MySQL,并对接 FineBi 和 Echarts 进行可视化报表展示。
技术架构:Flume + Kafka + Hbase + Hive + Spark + Phoenix + Sqoop + MySQL
1.通过 Flume 和 Sqoop 采集业务数据和日志数据,并将数据导入 Kafka 中;
2. 编写 Java Api 消费 Kafka 主题,将结果数据写入 Hbase;
3. 通过 Hive 关联 Hbase 中的数据,并对数仓进行分层;
4. 使用 pyspark 进行分析计算,如日活,曝光,环比,同比等,将结果写入 ADS 层;
5. 编写 shell 脚本和 python 脚本,通过 HIS 对任务定时调度;
6. 将 ADS 层中的数据,通过 Sqoop 导出到 MySQL 中,并通过 FineBi 将结果展示出来。