混合云 K8s+GPU 推理运维平台建设

医疗健康 医患问答 案例ID:248606
Iris Lin
5 年经验· 海虎科技
微信扫码沟通,客服可协助直接对接工程师;如当前档期不合,也可继续推荐相似案例作者。

案例介绍

语言技术:Kubernetes、Linux、Prometheus、Ansible、vLLM
项目简介:本项目面向企业内部 AI 业务与业务系统,搭建混合云 Kubernetes 集群,支撑业务服务以及 GPU 大模型推理业务落地,完成集群运维、监控告警、资源治理、信创数据库迁移整套基础设施运维工作。
本人全权负责基础设施运维工作:
1、部署维护 TKE/ACK 混合 K8s 集群,完成集群调优、资源配额管控、安全加固,处理日常集群故障、Pod 异常、节点问题;
2、搭建 GPU 推理环境,部署 vLLM 推理服务,配置 NVIDIA DCGM 监控,实现 GPU 资源利用率监控告警;
3、基于 Prometheus+Grafana 搭建完整监控大盘,优化告警规则,做告警降噪,对接告警通知;
4、使用 Ansible 编写自动化运维脚本,实现批量服务器配置、环境初始化,提升运维效率;
5、完成 MySQL 向达梦 DM8 信创数据库迁移工作,数据迁移、备份恢复、业务适配调优;
6、落地 CI/CD 交付流程,使用 Helm 管理应用发布,输出运维 SOP 操作文档,处理线上突发故障。
项目成果:集群稳定性提升,降低人工运维工作量,GPU 资源利用率提升,顺利完成国产化数据库改造,支撑业务稳定运行。
演示地址:项目为企业内网基础设施环境,无对外公开演示地址,可提供运维文档、架构说明沟通验证。

混合云 K8s+GPU 推理运维平台建设

医疗健康 · 医患问答 案例ID:248606
联系该工程师
微信扫码,建群沟通
作者: Iris Lin - 5年经验- 海虎科技

案例介绍

语言技术:Kubernetes、Linux、Prometheus、Ansible、vLLM
项目简介:本项目面向企业内部 AI 业务与业务系统,搭建混合云 Kubernetes 集群,支撑业务服务以及 GPU 大模型推理业务落地,完成集群运维、监控告警、资源治理、信创数据库迁移整套基础设施运维工作。
本人全权负责基础设施运维工作:
1、部署维护 TKE/ACK 混合 K8s 集群,完成集群调优、资源配额管控、安全加固,处理日常集群故障、Pod 异常、节点问题;
2、搭建 GPU 推理环境,部署 vLLM 推理服务,配置 NVIDIA DCGM 监控,实现 GPU 资源利用率监控告警;
3、基于 Prometheus+Grafana 搭建完整监控大盘,优化告警规则,做告警降噪,对接告警通知;
4、使用 Ansible 编写自动化运维脚本,实现批量服务器配置、环境初始化,提升运维效率;
5、完成 MySQL 向达梦 DM8 信创数据库迁移工作,数据迁移、备份恢复、业务适配调优;
6、落地 CI/CD 交付流程,使用 Helm 管理应用发布,输出运维 SOP 操作文档,处理线上突发故障。
项目成果:集群稳定性提升,降低人工运维工作量,GPU 资源利用率提升,顺利完成国产化数据库改造,支撑业务稳定运行。
演示地址:项目为企业内网基础设施环境,无对外公开演示地址,可提供运维文档、架构说明沟通验证。

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在 1 小时内与您联系确认。

1小时精推人才

需求方专属客服,免费梳理匹配

需求方客服微信二维码
扫码加微信 · 客服人工对接
更多案例
微信沟通 客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×