责任描述:
一、运维部分:独立维护集团zk+kafka、clickhouse集群300+节点,配合维护azkaban、hadoop、
presto集群以及报表系统。负责数据中台建设过程中集群融合改造和迁移。
二、开发部分:参与数据中台的基础产品建设包括埋点上报管理平台、行为分析平台、数据质量
监控平台等平台,为平台提供千亿级数据的处理解决方案以及数据开发支持和后端开发支持。
工作内容:
1、参与数据中台从0-1的建设,参与埋点上报平台,专题分析平台等数据产品的springboot后端
研发以及flink、spark数据开发。独立使用flink开发支持了埋点事件实时统计、上报日志抽样分析
等模块,处理结果分钟级写入Tidb集群。累计上线维护flink实时任务150+。
2、负责clickhouse集群架构设计,搭建维护优化,使用flink秒级消费kafka上报日志写入,保障
日常OLAP查询稳定,并控制80%的OLAP查询在5S以内。
3、负责集团内zk+kafka集群的架构设计搭建维护扩容优化,故障处理等,保障了100+kafka节点,
峰值100w/s qps的数据稳定读写。
4、开发flink实时写入hive数仓、clickhouse通用程序,可处理protobuf,json 等数据格式每日
百亿级数据稳定写入。
5、使用sqoop、gobblin配合azkaban,airflow等调度系统处理每日200+的数据库表 T+1天从数据
库同步至离线数仓ODS层。
6、开发flink实时新增用户统计程序,对接外拉新平台,消费kafka数据,通过redis以及flink
state的去重,将新增用户信息通过kafka推动至外拉新平台。
7、负责公司调度平台azkaban的维护升级、二次开发,独立开发了企微、电话、SLA告警模块,a
平台日均调度任务300+。
8、负责公司海外AWS数据同步国内阿里云,跨海专线采购,网络打通。以及部署维护kafkamirror
实时同步两个跨海kafka集群。
9、在hadoop集群迁移过程中负责底层数据,hive元数据的迁移,累计迁移 hive表1000+,底层数
据10PB
10、负责使用spark开发Hdfs集群小文件合并工具,针对namenode压力日益增大的问题,该工具
累计合并减少文件数六千万,合并数据3PB。