ahua

大数据开发工程师
联想 · 5年经验
ahua
日薪: ¥800/8h
地点: 深圳
时间: 下班后周六周日可工作日远程
ID:431164 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | Spark Flink
五年大数据开发经验,技术栈覆盖实时计算、数据湖与离线数仓。核心领域:实时计算(Flink/Spark Streaming)、流批一体架构(Paimon/Iceberg)、数据湖存储与查询优化。擅长场景:高吞吐低延迟的实时ETL、大状态下的Exactly-Once语义保障、复杂数据血缘与多流关联处理、数据湖增量入湖与合并策略优化。解决问题:业务方数据产出延迟、资源成本过高、实时离线口径不一致等痛点。持续关注Lakehouse、CDC等技术演进,致力于通过合理架构设计降低运维复杂度、提升数据质量与产出效率。

项目一:实时数仓架构升级(Flink + Paimon)
传统Lambda架构存在离线/实时口径不一致、存储冗余问题。负责将原有Kafka+Flink实时链路与Hive离线链路合并为流批一体架构,基于Paimon统一存储底座,Flink同时承担流式写入与批式修正。结果:数据延迟从T+1提升至分钟级,计算资源节省约30%,彻底消除实时离线对账争议。

项目二:百亿级日志实时清洗与多流关联(Flink + Kafka + ClickHouse)
埋点日志峰值QPS超50万,需实时清洗并与用户画像、商品维表做双流关联。负责设计Kafka分区策略与Flink状态后端(RocksDB)调优,解决大状态下的Checkpoint超时与反压问题。结果:端到端延迟压至秒级,支撑每日百亿级数据稳定入湖,SLA达99.9%。

项目三:离线数仓分层建模与任务调优(Spark + Hive + DolphinScheduler)
原始ODS层存在大量数据倾斜与长尾任务,核心DWS层产出常延迟2小时以上。主导表结构优化(分区/分桶调优)、Spark参数调优(AQE + Dynamic Partition Pruning)及任务依赖重构。结果:核心报表产出提前至早晨8点前,数据存储成本下降约25%。
ahua ID:431164 复制

ahua

大数据开发工程师 · 5年经验 · 联想
城市深圳 日薪800元/8h 时间 下班后周六周日可工作日远程
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | Spark Flink
五年大数据开发经验,技术栈覆盖实时计算、数据湖与离线数仓。核心领域:实时计算(Flink/Spark Streaming)、流批一体架构(Paimon/Iceberg)、数据湖存储与查询优化。擅长场景:高吞吐低延迟的实时ETL、大状态下的Exactly-Once语义保障、复杂数据血缘与多流关联处理、数据湖增量入湖与合并策略优化。解决问题:业务方数据产出延迟、资源成本过高、实时离线口径不一致等痛点。持续关注Lakehouse、CDC等技术演进,致力于通过合理架构设计降低运维复杂度、提升数据质量与产出效率。

项目经验

项目一:实时数仓架构升级(Flink + Paimon)
传统Lambda架构存在离线/实时口径不一致、存储冗余问题。负责将原有Kafka+Flink实时链路与Hive离线链路合并为流批一体架构,基于Paimon统一存储底座,Flink同时承担流式写入与批式修正。结果:数据延迟从T+1提升至分钟级,计算资源节省约30%,彻底消除实时离线对账争议。

项目二:百亿级日志实时清洗与多流关联(Flink + Kafka + ClickHouse)
埋点日志峰值QPS超50万,需实时清洗并与用户画像、商品维表做双流关联。负责设计Kafka分区策略与Flink状态后端(RocksDB)调优,解决大状态下的Checkpoint超时与反压问题。结果:端到端延迟压至秒级,支撑每日百亿级数据稳定入湖,SLA达99.9%。

项目三:离线数仓分层建模与任务调优(Spark + Hive + DolphinScheduler)
原始ODS层存在大量数据倾斜与长尾任务,核心DWS层产出常延迟2小时以上。主导表结构优化(分区/分桶调优)、Spark参数调优(AQE + Dynamic Partition Pruning)及任务依赖重构。结果:核心报表产出提前至早晨8点前,数据存储成本下降约25%。
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏