项目一:HERK用户画像个性化推荐平台
项目周期:2023.5-2023.12
项目描述:
该项目是基于我们公司的电商数据仓库,专为公司商城的用户设计的一个用户画像平台。它通过分析用户的社交属性、生活习惯和消费行为等信息,创建出一个标签化的用户模型。这个模型旨在为用户提供个性化的产品推荐,并为我们的决策提供数据支持。数据来源主要包括Mysql中的用户表、订单表、订单商品表以及用户行为日志。从四个主要维度来给用户打标签:人口属性(如性别、职业)、商业属性(如消费能力)、行为属性(如购物频率、浏览习惯)和用户价值(如购买力、忠诚度)。标签的实现方式主要有三种:规则匹配类标签(例如根据用户提供的信息判断其性别和职业)、统计类标签(例如通过分析用户的购物记录计算其消费周期和支付偏好)以及挖掘类标签(例如通过机器学习算法预测用户的潜在需求)。
项目架构:
Hadoop+SparkSQL+MySQL+Elasticsearch+DataX+Flume+SparkMLIB+DolphinScheduler
责任描述:
1. 将Hive中经过数据清洗和ETL(提取、转换、加载)处理后的订单表、订单商品表、用户表等业务数据迁移到Elasticsearch中。这些数据为后续的标签开发提供了基础。
2. 使用SparkSQL进行性别、年龄、职业等规则匹配类标签的开发工作。
3. 同样利用SparkSQL完成消费周期、支付方式等统计类标签的开发。
4.进行代码重构,针对工具类、公共模块和重复功能进行提取和封装。例如,可以将标签开发流程提炼为一个抽象的父类,以便于复用和管理。
5.通过走查代码并进行优化,如减少无条件join、精简action算子、优先过滤数据、调整分区数等,可以提升代码执行效率和资源利用率,从而提高整体性能和代码质量。