1. 日志解析及清洗过滤入 Hive 数据仓库,包括数据的过滤,抽取,转换,加载等过程。
2. 维度建模,将公司原不合理计算方式重新进行数仓维度建模处理,建立符合业务需求的星型模型,大大提高了计算速度,
减少不必要重复计算,使整个数仓逻辑更加清晰,响应更加及时。深度参与整个数仓改造调整,包括维度退化,缓慢变化
维度处理等
3. 主题建模,将上层数据按照不同的主题分别进行汇总处理,如按用户维度,广告维度等
4. 负责产品总体数据以及特定需求产出对应报表,包括但不限于用户留存指标、用户行为分析,点击流,新用户流程分析,
启动行为,广告曝光点击 pv、uv,激励视频浏览完成度,用户连续登录统计,用户生命周期内所有行为等等其他复杂业
务需求。
5. 大数据集群性能优化,包括对执行速度缓慢或无法成功计算的脚本进行调优(曾将需 3 小时执行的脚本优化到 30 分钟),
处理数据倾斜问题,将小文件合并提高性能,编写自定义 UDF,UDTF,UDAF 来减少 sql 代码,提高计算速度。
6. 元数据管理及数据质量管理,包括对整个计算过程中数据是否缺失,脏数据来源追溯,以及对元数据更改情况进行记录,
保证数据完整性、可用性、可信性等要求。
7. 设计 Mysql 表结构,优化表格加载缓慢问题,解决在大量数据情况下在可接受时间内返回处理结果
8. 调度任务血缘关系管理,对每日上千个定时任务以及互相依赖问题进行梳理,保证任务流畅执行,恢复任务方便等要求。
9. 对数据资产进行权限管控,保证关键数据不外泄,同时保证用户权限灵活添加,用户权限查询方便。
10. 编写工具脚本,方便团队其他成员使用,对日常工作有帮助的新特性探索等