项目角色:大数据开发工程师(核心开发)
技术栈:Flink、Kafka、HBase、Redis、Java/Python
项目描述:
构建高吞吐、低延迟的数据采集系统,日均处理百亿级日志数据(用户行为、设备埋点、业务日志),完成数据清洗、实时ETL、指标计算及存储。
核心贡献:
数据采集:基于Kafka + Flink搭建分布式采集管道,优化并行度与反压机制,单集群峰值处理能力达50万条/秒。
数据清洗:使用Flink State处理脏数据(去重、格式校验、异常过滤),数据可用率提升至99.9%。
实时统计:通过Flink窗口计算(Tumbling/Sliding Window)实时生成PV/UV、设备活跃度等指标,写入HBase供业务查询。
存储优化:设计HBase RowKey分区策略,避免热点问题,查询延迟控制在100ms内。
成果:
系统稳定运行1年+,日均处理数据量100亿+,延迟<1秒。
替代原有Storm方案,资源消耗降低40%,运维成本大幅减少。
青路云企业版是面向不同行业企业打造的综合用车服务平台,企业管
AIHao智控平台是一套为车队及企业提供驾驶员与车辆智能管理
一、环境质量监测数据管理平台聚焦政府环保部门、工业园区及第三
通过网络爬虫爬取房产租赁数据,并对房产租赁数据统计,以及对房
本项目通过对B站视频的互动数据进行采集和分析,深入了解用户行
我是一名拥有8年经验的高级数据工程师,擅长构建高可用数据管道
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者