主导 Python 数据 Pipeline 搭建,通过 Spark Streaming 实时处理用户日志,经 Pandas 清洗后入 Hive 数仓。构建留存/转化模型,以 Flask 输出分析 API。攻克 数据倾斜难题(优化分区策略),日均处理千万级数据,分析报告推动产品迭代,实现用户活跃度提升 5%。本人负责数据流程设计与机器学习模型开发。
主导 Python 数据 Pipeline 搭建,通过 Spark Streaming 实时处理用户日志,经 Pandas 清洗后入 Hive 数仓。构建留存/转化模型,以 Flask 输出分析 API。攻克 数据倾斜难题(优化分区策略),日均处理千万级数据,分析报告推动产品迭代,实现用户活跃度提升 5%。本人负责数据流程设计与机器学习模型开发。...
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人