1. 能灵活运用Hive、Spark实现海量ETL加工处理、分析数据,精通SQL,有一定的SQL性能调优经验
2. 熟悉数据仓库模型设计方法论,有实际模型设计及 ETL 开发经验,对 3NF 范式、星型模型、雪花模型有一定理解,理解
数仓分层理论
3. 掌握 Hadoop、Spark 架构及运行原理,了解 Kafka、Flume、Hbase 等组件
4. 熟练掌握Java语言、熟悉Scala语言,熟悉Shell脚本编程,掌握linux常用命令
项目名称(一):企业级大数据平台中心——北京东方国信股份有限公司(区块节点)-2019 年 4 月至今
项目描述:负责公司旗下多款 app 的数据分析,包括新闻、工具、广告、游戏、电商类等共五大类,共 30 余种 app。深度参
与数据处理分析整个流程,日志解析-清洗-数仓建模-数据分析-报表展示-用户画像等。旨在为公司决策层决策提供数据支持,
提供产品整体运行状态评估,为广告投放等关键指标提供事实支撑,以及帮助产品经理对功能的改进提出数据意见等功能。
技术选型:Hive-Spark-Hadoop-Flume-Kafka-Sqoop-Hbase-Mysql-Linux-Jenkins-Grafana
责任描述 :
1. 日志解析及清洗过滤入 Hive 数据仓库,包括数据的过滤,抽取,转换,加载等过程。
2. 维度建模,将公司原不合理计算方式重新进行数仓维度建模处理,建立符合业务需求的星型模型,大大提高了计算速度,
减少不必要重复计算,使整个数仓逻辑更加清晰,响应更加及时。深度参与整个数仓改造调整,包括维度退化,缓慢变化
维度处理等
3. 主题建模,将上层数据按照不同的主题分别进行汇总处理,如按用户维度,广告维度等
4. 负责产品总体数据以及特定需求产出对应报表,包括但不限于用户留存指标、用户行为分析,点击流,新用户流程分析,
启动行为,广告曝光点击 pv、uv,激励视频浏览完成度,用户连续登录统计,用户生命周期内所有行为等等其他复杂业
务需求。
5. 大数据集群性能优化,包括对执行速度缓慢或无法成功计算的脚本进行调优(曾将需 3 小时执行的脚本优化到 30 分钟),
处理数据倾斜问题,将小文件合并提高性能,编写自定义 UDF,UDTF,UDAF 来减少 sql 代码,提高计算速度。
6. 元数据管理及数据质量管理,包括对整个计算过程中数据是否缺失,脏数据来源追溯,以及对元数据更改情况进行记录,
保证数据完整性、可用性、可信性等要求。
7. 设计 Mysql 表结构,优化表格加载缓慢问题,解决在大量数据情况下在可接受时间内返回处理结果
8. 调度任务血缘关系管理,对每日上千个定时任务以及互相依赖问题进行梳理,保证任务流畅执行,恢复任务方便等要求。
9. 对数据资产进行权限管控,保证关键数据不外泄,同时保证用户权限灵活添加,用户权限查询方便。
10. 编写工具脚本,方便团队其他成员使用,对日常工作有帮助的新特性探索等