大数据基础平台-星海平台
项目介绍:海量数据存储、计算、查询和分析的大数据存储和计算平台。可自动化搭建大数据集群,高度契合大数据业务场景;
轻松扩展以满足不断增长的数据存储和处理需求;支持自动化安装部署,支持对服务进行统一配置管理;可对集群状态进行全面
监控,快速发现并解决问题;提供完完整的安全防护体系。服务组件包括:Raptor、Elasticsearch、Kafka、Zookeeper、
Monitor、HDFS、YARN、Hive、Spark、Flink、HBase、KNOX、Security Center、NebulaGraph、DolphinScheduler
等。该平台主要用于公司内部以及客户现场部署使用。
平台涉及技术: Java、Python、C++、Shell、SpringBoot、Jetty、Ambari、SQL等。
工作经验
2016-08 ~ 2021-10 北京赛思信安技术股份有限公司 大数据开发工程师
责任描述:
一 HBase模块
组件介绍: 主要用于公司内部业务产线使用,为Matrix分析平台、XLab实验室、锡安平台等提供数据和检索支持。
HBase集群规模: 2个集群,Master为HA,regionserver节点数为360和270,数据量均为PB级。
职责:
1) 处理大数据平台HBase组件的问题,包括常见的rit问题(region处于opening、splitting、offline状态)、HBase占用内
存过高问题、bulkload执行失败问题、scan操作导致集群负载过高等问题。
2) 负责平台和产品HBase新版本的发布打包工作。
3) 负责大数据平台HBase集群间的数据迁移工作。
4) 负责平滑升级HBase版本(从1.2.6升级到2.1.1)的工作。
5) 负责HBase Bug修复工作。
成果: 确保集群和产品的HBase稳定运行,未出现重大事故。
二 NebulaGraph模块
组件介绍: 该组件为图数据,主要用于威胁情报、技术研究院、网络安全部等部门做数据分析以及数据回溯使用
NebulaGraph集群规模: 3集群,共300亿数据量,其中点120亿,边180亿。
职责:
1) 处理NebulaGraph运行中遇到的问题,包括内存使用过多导致的storaged掉线、业务人员使用nGQL遇到的问题等。
2) 进行版本新特性调研并进行升级测试。
3) 负责部分数据加载工作,包括使用Java消费Kafka进行数据过滤和简单处理,然后将数据导入Nebula;通过
DolphinScheduler调度器执行Spark对HDFS数据进行处理,并导入Nebula。
4) 负责NebulaGraph源码接入Jenkins、prs出包工作。
5) 完成业务集群拆分、数据迁移等,提高业务使用集群的性能,避免多业务使用同一集群带来的资源紧张问题等。
成果:确保NebulaGraph的稳定运行、支持业务完成工作。NebulaGraph社区contributor。
三 DolphinScheduler模块
组件介绍: 该组件为任务调度工具,主要是玄机平台业务部门提交任务作业使用,包括flink、spark、hive、shell、mapreduce
等。该组件可通过管理界面查询、操作运行作业的状态;可通过http接口控制任务及工作流状态;可添加告警邮件通知;可实时
监控节点资源;权限管理功能;可自由切换使用不同集群的客户端等;
DolphinScheduler集群规模: 8节点,3个master,5个worker。
职责:
1) 根据玄机平台接口需求,开发新的接口功能。
2) 修复任务实例状态显示异常bug。
3) 修复接口文档访问权限漏洞。
4) 处理日志不能正常打印、资源不足的导致的其他问题等。
成果:确保DolphinScheduler的稳定运行、支持业务完成工作。
四 基础平台建设模块
项目介绍:星海平台是我们公司集成大数据各个组件的产品。该产品是提供给客户部署安装使用。支持大数据各种离线以及
实时作业的运行,还包括一些数据库的读写、NOSQL型数据库操作以及ES的操作。主要解决的问题就是对于大数据各个组件
的一站式管理以及定制化服务。该平台一直在维护和使用中。
职责:
1) 开发新组件集成到星海平台,包括DolphinScheduler、Mariadb、PostgresSql、Redis等。
2) 处理旧版本中平台本身以及组件存在的bug、修复平台和组件的漏洞。
3) 研发版本对应的补丁包和升级包。
成果: 完成公司星海平台多个版本的大数组件的集成、补丁包、升级包研发,成功发布星海