项目一:公有云平台从0到1建设(运维主管)
以OpenStack为底座构建公有云平台(功能类似阿里云/腾讯云),服务200+客户,含十几家大客户。通过Kayobe工具标准化部署,物理环境就绪后1天内部署完毕。总部署8套环境(5正式+3测试),维护近千台云主机,平均30分钟内恢复业务故障。主导完成等保三级认证系统侧整改,包括漏洞扫描、数据实时备份、漏洞修复等。
项目二:运维管理平台与监控体系建设(运维主管)
基于vSphere集群从0到1构建完整运维体系,部署30+运维工具(Prometheus+ELK+Grafana+Zabbix+JumpServer+GitLab+Jenkins+OpenVPN等),实现立体监控、权责划分、资源管理。编写运维平台使用手册,制定运维行为标准,统一团队操作规范。
项目三:K8s微服务可观测性体系建设(运维工程师)
基于Prometheus+Grafana+EFK构建Kubernetes全维度可观测平台,实现集群资源监控、微服务指标采集、日志统一归集与可视化分析。通过指标告警、日志关联检索,将系统故障排查与定位时长从30分钟缩短至3分钟(提升10倍),有效支撑50+微服务稳定运行。
项目四:Ceph存储集群深度优化(运维主管)
解决OSD写入延迟抖动问题,PG数量从128优化至256,配置CRUSH Map实现故障域隔离。OSD读写延迟从12ms降至3ms(提升75%),集群IOPS提升40%,支撑OpenStack 300+云硬盘稳定运行。
项目五:AI基础设施部署(运维工程师)
在Dify平台设计并落地10+AI工作流(智能告警分析、日志异常检测、变更审批助手),告警处理效率提升50%,误报率降低40%。对Qwen2.5-14B进行QLoRA微调,使用运维日志+故障案例构建5000+条指令数据集,故障诊断准确率从42%提升至78%。