通过Flume程序实时监控采集商城日志数据文件,实时采集到kafka作为原始日志数据
使用FlinkCDC实时迁移Mysql中的用户行为数据存到kafka中构建ods层
调用重分区算子,rescale,rebalance,shuffle解决kafka的topic分区之间数据不均匀,防止数据倾斜
负责构建dwd层通过Flink应用程序使用操作符对ods层数据进行清洗,过滤等操作
使用redis作为热点数据的旁路缓存,使用Flink的异步IO实现对外部系统的异步访问,提高程序性能
构建DWS宽表:通过预加载,双流join,lookupjoin实现维度关联,将宽表数据存入Clickhouse
使用异步IO实现连续发送多个请求,提高并发效果,减少多请求等待带来的消耗
通过ReplacingMergeTree保证最终一致性,查询时的sql语法加上去重逻辑,保证ClickHouse的一致性
利用web ui定位,查看火焰图平顶,并分析GC日志,调整资源解决Flink反压
ADS层指标:产品总数,上架商品的sku/spu数,交易成功指标数,浏览下单数,支付买家数等
使用DataV调用接口进行可视化报表展示
参与将项目部署到Flink on Yarn,通过WebUI查看资源使用,以提高集群的资源利用率
负责阿里云离线项目的整体架构设计和实施,包括技术选型、系统数据流程设计等
使用Flume等日志采集工具进行日志采集和聚合
利用MaxCompute等大数据计算框架进行数据处理和分析,为项目提供数据支持
使用Quick BI、DataV等工具进行数据可视化展示,为项目提供直观的数据视图
负责数据的安全性和隔离性,采取必要的措施防止数据异常和敏感数据泄露
设置定时调度任务,对项目进行监控和管理,确保项目的正常运行