欢仔

大数据技术经理
明源云 · 11年经验
欢仔
日薪: ¥800/8h
地点: 北京 海淀
时间: 下班后周六周日可工作日远程
ID:401184 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | Java Kafka Python Hadoop yarn 分布式 Spark Flink HBase Hive 项目管理
个人优势:
1、深耕大数据领域多年,积累深厚专业知识与丰富实战经验​
2、成功主导多个大数据项目从 0 到 1 全流程推进,有较强的项目管理能力​
3、在技术选型、架构设计、数据仓库搭建及数据治理方面经验丰富,擅于定制高效技术方案
4、多年的java开发、大数据开发与团队管理经验

技术栈:
1、深入理解Java、Python核心机制,有良好的编码能力
2、掌握 Java并发编程,AQS实现原理、线程池任务调度策略、volatile可见性/禁止指令重排、synchronized锁升级
3、深入理解 JVM内存模型(堆/栈/元空间)、类加载机制(双亲委派/自定义ClassLoader)
4、熟悉垃圾回收策略,GC算法,各类垃圾回收器
5、精通Hadoop生态体系(HDFS/Yarn/MapReduce),具备TB级集群性能调优经验
6、熟悉Hive数据仓库设计与优化(分区/分桶/压缩),可开发UDF/UDAF函数解决复杂ETL问题
7、深度掌握Spark内核(DAG调度/内存管理/Shuffle机制),熟悉使用RDD、SparkSQL开发,并能进行性能优化
8、熟悉Flink实时计算引擎(Checkpoint/State TTL/时间窗口),主导端到端Exactly-Once流处理项目
9、精通Kafka架构和工作原理,ISR机制/副本同步/零拷贝
10、熟悉Hbase分布式框架,理解读写原理,结合Phoenix提升查询效率
11、熟悉StarRocks查询引擎,表模型、雾化视图

产业BG大数据平台
软件架构: 整体采用Lambda架构
离线: hadoop + hive + spark + starrocks + datax
实时: flink cdc + kafka + hbase + phoenix + flink + starrocks
项目描述:
项目采取Lambda架构,分为实时/离线两部分,离线架构用datax T+1 将业务库表同步到hdfs上; 计算引擎采用hive on spark,用于执行数仓sql;查询引擎是starrocks,用于olap数据分析;并以此构建数据仓库 ods->dwd->dws->ads,以宽表、报表、指标、接口 提供数据服务
实时架构通过flink cdc 实时采集业务库binlog日志,维度表数据通过phoenix写入hbase,事实表数据写入kafka表队列;dwd层通过flink任务将kafka表队列数据与hbase维度表数据进行关联操作生成宽表,并siink到starrocks或kafka dwd表队,dws层通过flink任务将kafka dwd表队列数据聚合计算后写入starrocks
责任描述:
1、负责大数据平台的架构设计,技术选型、难点技术攻克
2、负责离线/实时数据仓库的设计与规划
3、负责数据仓库建模,宽表和指标设计与制定
4、参与Flink流式计算的代码开发,与性能优化
5、负责平台SLA保障与数据质量监控
欢仔 ID:401184 复制

欢仔

大数据技术经理 · 11年经验 · 明源云
城市北京 海淀 日薪800元/8h 时间 下班后周六周日可工作日远程
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | Java Kafka Python Hadoop yarn 分布式 Spark Flink HBase Hive 项目管理
个人优势:
1、深耕大数据领域多年,积累深厚专业知识与丰富实战经验​
2、成功主导多个大数据项目从 0 到 1 全流程推进,有较强的项目管理能力​
3、在技术选型、架构设计、数据仓库搭建及数据治理方面经验丰富,擅于定制高效技术方案
4、多年的java开发、大数据开发与团队管理经验

技术栈:
1、深入理解Java、Python核心机制,有良好的编码能力
2、掌握 Java并发编程,AQS实现原理、线程池任务调度策略、volatile可见性/禁止指令重排、synchronized锁升级
3、深入理解 JVM内存模型(堆/栈/元空间)、类加载机制(双亲委派/自定义ClassLoader)
4、熟悉垃圾回收策略,GC算法,各类垃圾回收器
5、精通Hadoop生态体系(HDFS/Yarn/MapReduce),具备TB级集群性能调优经验
6、熟悉Hive数据仓库设计与优化(分区/分桶/压缩),可开发UDF/UDAF函数解决复杂ETL问题
7、深度掌握Spark内核(DAG调度/内存管理/Shuffle机制),熟悉使用RDD、SparkSQL开发,并能进行性能优化
8、熟悉Flink实时计算引擎(Checkpoint/State TTL/时间窗口),主导端到端Exactly-Once流处理项目
9、精通Kafka架构和工作原理,ISR机制/副本同步/零拷贝
10、熟悉Hbase分布式框架,理解读写原理,结合Phoenix提升查询效率
11、熟悉StarRocks查询引擎,表模型、雾化视图

项目经验

产业BG大数据平台
软件架构: 整体采用Lambda架构
离线: hadoop + hive + spark + starrocks + datax
实时: flink cdc + kafka + hbase + phoenix + flink + starrocks
项目描述:
项目采取Lambda架构,分为实时/离线两部分,离线架构用datax T+1 将业务库表同步到hdfs上; 计算引擎采用hive on spark,用于执行数仓sql;查询引擎是starrocks,用于olap数据分析;并以此构建数据仓库 ods->dwd->dws->ads,以宽表、报表、指标、接口 提供数据服务
实时架构通过flink cdc 实时采集业务库binlog日志,维度表数据通过phoenix写入hbase,事实表数据写入kafka表队列;dwd层通过flink任务将kafka表队列数据与hbase维度表数据进行关联操作生成宽表,并siink到starrocks或kafka dwd表队,dws层通过flink任务将kafka dwd表队列数据聚合计算后写入starrocks
责任描述:
1、负责大数据平台的架构设计,技术选型、难点技术攻克
2、负责离线/实时数据仓库的设计与规划
3、负责数据仓库建模,宽表和指标设计与制定
4、参与Flink流式计算的代码开发,与性能优化
5、负责平台SLA保障与数据质量监控
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏