熟悉业务架构方面的规划
熟练掌握阿里专有云自动化运维平台的使用。
熟练掌握阿里以专有云产品的使用及资源处理。
熟练掌握Linux系统的使用和基础的Shell脚本编程。
熟练掌握常用数据库Mysql,包括常见sql操作。
熟练掌握Python、Go语言的开发使用。
熟悉Kubernetes 容器编排、Docker等技术。
熟悉nacos、xxl-job、starrocks、zookeeper等开源中间件。
熟悉常用监控产品 Prometheus、Grafana、ELK等。
熟悉基本的运维操作命令及规范流程等。
了解AI相关大模型部署等。
大型云平台维护
项目描述:专有云区+公有云区-主备机房服务器达到2000+台
项目角色:SRE
工作内容:
1.负责云平台⽇常运维,包括但不限于云平台巡检(底座、元数据库)、云产品⽔位管理扩容、⼯单问题
排查及变更、平台⻛险点修复、故障应急处理、重⼤节⽇护航保障等,切实保障平台稳定,并依靠保障⾃
定义核⼼指标提⾼平台可⽤性。
2.协助政务云初期的运维体系建设。
3.跨团队进行产品缺陷及风险的对接,跟进固化修复情况。
4.按照产品提供的深度巡检文档编写深度巡检脚本,每月产出深度巡检月报。
5.整理常规问题的处理方法,落地形成文档与团队同步。
6.进行专有云及公有云平台飞天系统重要版本升级及平台产品Bug修复。
运维平台模块研发
项目描述:公司运维平台--监控、建站、集群容灾等功能模块研发
项目角色:运维开发
工作内容:
1、负责监控模块研发,包括结合ELK、Prometheus、Grafana集成服务器、应用、数据库、前端整
个系统的性能监控大盘。便于快速定位问题,观察资源水位,提高巡检效率等。
2、负责建站模块研发,包括基准环境标准化,优化离线出包流程及一键部署效率。加快了整体系统
交付速度。
负责集群容灾模块研发,主要针对双集群架构研发双集群切流、双集群版本对比及版本同步模
块。提高频繁批量更新应用导致故障的快速恢复能力。
his系统稳定性保障
项目描述:同城双活虚拟机达到1000+台
项目角色:项目运维负责人
工作内容:
1、负责日常研发迭代发布配置等更新
2、负责整体稳定性工作,完成双集群架构保障批量发布故障的秒级恢复能力。
3、协助完成主要his系统和三方服务迁移,并且主导完成整体his系统双集群架构及同城双活的实施方
案和建设落地。
4、优化整体系统高可靠能力,发布流程优化,完善监控告警。
5、协助完成电子病历、互联互通等各类评审工作。
6、整理输出项目标准及变更规范相关文档。
7、负责部署及整体运维多个大型医院项目系统。
8、对接售前团队,提供资源评估、架构讲解以及各类评级答疑工作。
9、完成了运维项目全周期sop相关文档,包括前期摸底、资源规划、客户问题QA文档、部署交付标准文
档等,完善了交付的整个流程标准化。
项目描述:大型医疗系统同城双活虚拟机达到1000+台 项目角色:项目运维负责人 工作内容: 1、负责日常研发迭代发布配置等更新 2、负责整体稳定性工作,完成双集群架构保障批量发布故障的秒级恢复能力。 3、协助完成主要his系统和三方服务迁移,并且主导完成整体his系统双
项目描述:公司运维平台--监控、建站、集群容灾等功能模块研发 项目角色:运维开发 工作内容: 1、负责平台监控模块研发,包括结合ELK、Prometheus、Grafana集成服务器、应用、数据库、前端整个系统的性能监控大盘。便于快速定位问题,观察资源水位,提高巡检效率等。