项目一:政务大数据协同BM监管(BM局项目)
1. 开发环境:Linux+Python3.7.4
2. 软件架构:Zookeeper3.6.1、Kafka2.5、KafkaEagleRedis6.0.5、Nginx(国密)、Mysql、Elasticsearch7.3
3.项目介绍:
在保密监管一体化的指导思路下,为了实现国家、省、和地级市各级保密监管平台之间的互联互通,各级保密机关的协同保密等需求,建设各级保密监管系统,制定覆盖全国的三级指挥调度机制。
4. 责任描述:
参与平台架构选择,并落实各个核心模块
完成业务功性能指标以及性能指标
4.技术要点
1)配置国密nginx,使用nginx配置https并实现反向代理和负载均衡
2)将上传或下发的指令等数据接收汇聚,封装后放入Kafka缓存队列中,使用kafkaeagle监控kafka
3)将一些结构复杂的数据先放入redis后再进行处理,将处理后的数据写入mysql
4)对于一些对搜索要求高并且数据量很大的数据,存入elasticsearch,通过scroll滚动查询的方式读取数据
5)使用Docker打包集群环境,实现一键部署
项目二:目标关系分析系统(BM局项目)
1. 开发环境:Linux+JDK1.8+Scala2.11
2. 软件架构:Flume,Kafka,SparkStreaming,Redis,ES,Hbase,phoenix ,Mysql,Maxwall,Flink
3. 责任描述:
参与平台的技术选型,版本选型及搭建
用户模块:分析各邮件系统用户数量,用户年龄段,性别等指标
预警模块:恶意登录分析
4. 技术要点
1)搭建信息采集通道并自定义Flume拦截器对数据信息ETL和分类,将数据发送到Kafka不同Topic
2)使用Maxwall对Mysql中数据进行监控,并拉取到Kafka中,并使用bootstrap拉取历史数据
3)SparkStreaming消费Kafka数据,并手动维护偏移量实现精准一次性消费
4)使用Redis保存SparkStreaming中间状态,利用Redis中Set结构进行去重,对于邮件关系等需要长期保存的状态,放到hbase中保存,方便后续需求实现(判断是否为首次)
5)针对Spark出现的各类性能问题如数据倾斜等进行调优
6)使用ES对特定数据进行存储
7)根据业务需求引入Flink的Watermark,设置合理延迟时间加侧输出流处理迟到数据
8)使用Flink对恶意登录指标进行分析并与Spark进行对比,使用Azkaban进行任务调度
项目三:三佳商城离线数据仓库
1. 开发环境:Linux+JDK1.8
2. 软件架构:Tomcat,Nginx,Flume,Ganglia,Zookeeper,Kafka,KafkaManager,Hadoop,MySQL,Hive,Sqoop, Azkaban,Zabbix
3. 项目介绍:
随着企业的数据量越来越大,需要搭建一个统一的数据采集通道采集数据,将这些数据集中的放在一个统一的数据仓库中管理,通过对业务数据和行为数据的汇总分析,可以为企业所有决策制定过程,提供所有系统数据的支持。帮助企业改进业务流程、控制成本、提高产品质量等。
4. 责任描述:
部署配置Flume,同时使用监视器Ganglia监控Flume
部署配置Kafka,同时使用监视器KafkaManager监控Kafka
搭建Hadoop集群HA,通过Zookeeper实现NameNode的热备份
参与数据仓库的搭建及分层
参与数据建模,确立维度表、事实表及拉链表
用户模块:新增用户,活跃用户,沉默用户,忠诚用户,周回流用户等指标
商品模块:差评率,退货率,收藏、销量等各类TopN
订单模块:下单笔数,交易成功单数,复购率,GMV等
5. 技术要点
1)安装Zookeeper,通过Zookeeper搭建Hadoop-HA高可用集群,并对集群进行基准测试和参数调优,安装LZO压缩格式,并配置HDFS多目录
2)部署Flume,使用TailDirSource采集服务器数据,使用KafkaChannel与Kafka对接,并自定义拦截器进行简单的数据清洗,使用Multiplexing选择器将不同的Event发往不同的Channel,以便将不同的数据发送到Kafka不同的topic上
3) 部署Kafka集群,并对Kafka集群进行压测以确定集群上限,配置Kafka常用参数,使用KafkaManager实现对Kafka集群运行状态的监控
4) 将Mysql业务数据通过S