DataLake(数据湖)
核心组件:Kylin,Spark,Hive,HDFS,Kafka,Azkaban,Zookeeper
功能模块:数据字典,数据管理,数据采集,数据集市,数据分析
工作内容:
1.数据抽取,项目的构建以springboot为基础,采用Spark进行数据的抽取和比对并进行类型转换处理。读取用户配置的待抽取数据存储信息,连接数据库或SFTP读取数据执行全量或增量逻辑将数据写入到parquet文件中,并执行分析使hive可以识别该parquet文件
2.数据清洗,设计了两种引擎执行用户编写的sql(hive,presto)
3.数据集市,采用Apache Kylin开源项目开发数据集市,数据分析模块,Apache Kylin是一个开源的分布式分析引擎,提供Hadoop之上的SQL查询接口及多维分析(OLAP)能力以支持超大规模数据。
NSM智能零件识别系统
核心技术: Django+Angular
功能模块:图片上传,图片识别,数据导入,信息管理
工作内容:
1.项目日常维护,包含添加用户管理员,重启服务
2.功能修改,增加获取图片时采用二进制方式传输,
3.服务器迁移,搭建零件识别所需的运行环境,cuda+python+TensorFlow+docker
Data As Service(DAAS数据服务平台)
核心技术:Spring + Springmvc + Mybatis + Redis + Maven + Vue
工作内容:
1.报表联动功能开发,该功能为数据下钻时,如果有相关联的图表同时下钻
2.ECharts图表功能添加,增加漏斗,仪表盘,雷达图等
3.前端开发及bug修改