产业BG大数据平台
软件架构: 整体采用Lambda架构
离线: hadoop + hive + spark + starrocks + datax
实时: flink cdc + kafka + hbase + phoenix + flink + starrocks
项目描述:
项目采取Lambda架构,分为实时/离线两部分,离线架构用datax T+1 将业务库表同步到hdfs上; 计算引擎采用hive on spark,用于执行数仓sql;查询引擎是starrocks,用于olap数据分析;并以此构建数据仓库 ods->dwd->dws->ads,以宽表、报表、指标、接口 提供数据服务
实时架构通过flink cdc 实时采集业务库binlog日志,维度表数据通过phoenix写入hbase,事实表数据写入kafka表队列;dwd层通过flink任务将kafka表队列数据与hbase维度表数据进行关联操作生成宽表,并siink到starrocks或kafka dwd表队,dws层通过flink任务将kafka dwd表队列数据聚合计算后写入starrocks
责任描述:
1、负责大数据平台的架构设计,技术选型、难点技术攻克
2、负责离线/实时数据仓库的设计与规划
3、负责数据仓库建模,宽表和指标设计与制定
4、参与Flink流式计算的代码开发,与性能优化
5、负责平台SLA保障与数据质量监控