挖酒电子商务平台
工作前期:
1).独立完成七牛云图片上传进行CDN迁移。
2).编写易宝支付代码,链接各大银行支付模块。
3).独立完成整合阿里大鱼验证码。
4).独立完成酒标生成二维码模块。
5).独立完成行业资讯CMS模块。
6).编写区域独家和独家体验后台业务代码。
7).编写赏味七夕活动模块。
8).配合开发团队进行联合调试和编写系统相关文档。
工作后期:
1).系统架构:spark+kafka+hdfs+zookeeper+hbase+flume+hive
2).三大模块:
(1)用户访问session分析模块
业务:按条件筛选session,统计出符合条件的session中,统计访问时长和访问步长在各个时间段的占比。按照时间比例随机抽取1000个session,获取点击、下单和支付数量排名前10的品类,对于排名前10的品类,分别获取其点击次数排名前10的session
技术点:数据的过滤与聚合、自定义Accumulator、按时间比例随机抽取算法、二次排序、分组取topN
(2)各区域热门商品统计模块
业务:区域级别的热门商品的统计业务,包括查询用户指定日期范围内的点击行为数据,各个区域下各个商品的点击量,使用开窗函数统计各区域的top3热门商品,使用内置case when函数给各个区域打上级别标记
技术点:Hive与MySQL异构数据源、RDD转换为DataFrame、注册和使用临时表、自定义UDAF聚合函数、自定义get_json_object等普通函数、Spark SQL的高级内置函数(if与case when等)、开窗函数
(3)广告点击流量实时统计模块
业务:广告点击流量的实时统计的业务。包括为动态黑名单实时计算每天各用户对各广告的点击次数,过滤出每个batch中的黑名单用户以生成动态黑名单,基于动态黑名单进行点击行为过滤,计算每天各省各城市各广告的点击量,每天各广告最近1小时滑动窗口内的点击趋势,计算每天各省的top3热门广告。
技术点:动态黑名单机制(动态生成黑名单以及黑名单过滤)、transform、updateStateByKey、transform与Spark SQL整合、window滑动窗口、高性能写数据库
(4)Spark整体技术点:
性能调优方案:普通调优、jvm调优、shuffle调优、算子调优
troubleshooting经验
数据倾斜解决方案