负责2000+服务器、网络、存储等基础设施运维,保障产品稳定运行
主导CICD 自动化体系搭建,基于 GitLab+Jenkins 设计流水线、编写 Pipeline 脚本,实现发布自动化与版本可追溯,显著降低发布故障率
搭建Prometheus+Grafana+AlertManager全链路监控体系,覆盖服务器、MySQL、Redis、Nginx、业务接口,实现异常分钟级告警,保障服务稳定性
独立部署 ELK 日志平台,统一收集 Nginx 与应用日志,建立错误日志告警机制,提升问题定位效率
负责 MySQL、Redis 等数据库日常运维、备份恢复、慢查询优化;引入 Archery 实现 SQL 审计与规范化管理
主导微服务架构升级,引入 Nacos、APISIX,实现服务注册发现、动态上下线、无损灰度发布,提升系统弹性
K8s 集群搭建,协助业务改造切换,优化 CICD 发布流程,支撑业务快速迭代
沉淀运维规范、自动化脚本(Shell/Python)与知识库,提升团队运维效率与标准化水平