语言技术:Kubernetes、Linux、Prometheus、Ansible、vLLM 项目简介:本项目面向企业内部 AI 业务与业务系统,搭建混合云 Kubernetes 集群,支撑业务服务以及 GPU 大模型推理业务落地,完成集群运维、监控告警、资源治理、信创数据库迁移整套基础设施运维工作。 本人全权负责基础设施运维工作: 1、部署维护 TKE/ACK 混合 K8s 集群,完成集群调优、资源配额管控、安全加固,处理日常集群故障、Pod 异常、节点问题; 2、搭建 GPU 推理环境,部署 vLLM 推理服务,配置 NVIDIA DCGM 监控,实现 GPU 资源利用率监控告警;
技术:Prometheus、Grafana、Linux、Shell、TKE 简介: 针对企业多套业务环境,统一建设监控告警体系,覆盖服务器、容器、数据库、GPU 硬件多维度指标;梳理云资源,做资源裁剪、配额限制,完成云成本治理;编写 Shell 自动化脚本,实现巡检、备份自动化,输出运维规范文档,快速响应线上各类故障排查,保障业务持续可用。 演示地址:企业内网环境,无对外访问地址。
语言技术:Kubernetes、Linux、Prometheus、Ansible、vLLM 项目简介:本项目面向企业内部 AI 业务与业务系统,搭建混合云 Kubernetes 集群,支撑业务服务以及 GPU 大模型推理业务落地,完成集群运维、监控告警、资源治理、信创数据库迁移整套基础设施运维工作。 本人全权负责基础设施运维工作: 1、部署维护 TKE/ACK 混合 K8s 集群,完成集群调优、资源配额管控、安全加固,处理日常集群故障、Pod 异常、节点问题; 2、搭建 GPU 推理环境,部署 vLLM 推理服务,配置 NVIDIA DCGM 监控,实现 GPU 资源利用率监控告警; ...
技术:Prometheus、Grafana、Linux、Shell、TKE 简介: 针对企业多套业务环境,统一建设监控告警体系,覆盖服务器、容器、数据库、GPU 硬件多维度指标;梳理云资源,做资源裁剪、配额限制,完成云成本治理;编写 Shell 自动化脚本,实现巡检、备份自动化,输出运维规范文档,快速响应线上各类故障排查,保障业务持续可用。 演示地址:企业内网环境,无对外访问地址。...
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人