语言技术:Kubernetes、Linux、Prometheus、Ansible、vLLM
项目简介:本项目面向企业内部 AI 业务与业务系统,搭建混合云 Kubernetes 集群,支撑业务服务以及 GPU 大模型推理业务落地,完成集群运维、监控告警、资源治理、信创数据库迁移整套基础设施运维工作。
本人全权负责基础设施运维工作:
1、部署维护 TKE/ACK 混合 K8s 集群,完成集群调优、资源配额管控、安全加固,处理日常集群故障、Pod 异常、节点问题;
2、搭建 GPU 推理环境,部署 vLLM 推理服务,配置 NVIDIA DCGM 监控,实现 GPU 资源利用率监控告警;
3、基于 Prometheus+Grafana 搭建完整监控大盘,优化告警规则,做告警降噪,对接告警通知;
4、使用 Ansible 编写自动化运维脚本,实现批量服务器配置、环境初始化,提升运维效率;
5、完成 MySQL 向达梦 DM8 信创数据库迁移工作,数据迁移、备份恢复、业务适配调优;
6、落地 CI/CD 交付流程,使用 Helm 管理应用发布,输出运维 SOP 操作文档,处理线上突发故障。
项目成果:集群稳定性提升,降低人工运维工作量,GPU 资源利用率提升,顺利完成国产化数据库改造,支撑业务稳定运行。
演示地址:项目为企业内网基础设施环境,无对外公开演示地址,可提供运维文档、架构说明沟通验证。
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者