项目名称: 基于 Kubernetes 的云原生 AI 对话服务自动化交付平台
项目角色: 云平台开发与运维 | 时间: 2025.09 - 2026.01
技术栈: Docker, Kubernetes (K3s/EKS), Helm, GitHub Actions, Prometheus + Grafana, Terraform, Python/FastAPI
项目描述:
针对传统 AI 模型部署环境不一致、扩缩容滞后的痛点,设计并实现了一套基于 K8s 的云原生 AI 服务交付平台。该平台实现了从代码提交到模型服务上线的全链路自动化,支持多版本灰度发布与弹性伸缩,保障了高并发场景下的服务稳定性。
核心职责与成果:
容器化与镜像优化: 负责 AI 推理服务的容器化改造,通过多阶段构建与层缓存优化,将 Docker 镜像体积从 4.2GB 缩减至 1.8GB,冷启动时间缩短 40%。
K8s 集群与服务编排: 搭建 3 节点 K8s 集群,使用 Helm Chart 标准化部署模型服务、API 网关及向量数据库;配置 HPA 策略,实现基于 GPU/CPU 利用率的自动弹性伸缩,成功支撑 500+ QPS 压测。
CI/CD 流水线建设: 基于 GitHub Actions 设计 GitOps 流水线,集成 Trivy 镜像安全扫描与自动化测试,实现代码合并后 5分钟内 自动完成构建、推送与集群更新,部署效率提升 80%。
可观测性体系搭建: 部署 Prometheus + Grafana 监控栈,自定义 AI 推理延迟、Token 生成速率等业务指标看板;配置 Alertmanager 告警规则,将故障发现时间从 10分钟缩短至 30秒。
基础设施即代码 (IaC): 使用 Terraform 管理云资源(VPC、ECS、OSS),实现开发/测试/生产三套环境的 一键创建与销毁,环境一致性达 100%