负责大模型业务的 K8s 容器化部署与推理性能调优。部署 Qwen-32B 推理服务,配置资源隔离避免资源争抢;围绕 KV Cache 显存占比、批处理上限、块大小、多卡并行等参数进行调优,tokens 输出速率提升约 60%;设计多实例部署与健康检查保障高可用,配合监控体系持续观察推理性能。
搭建覆盖基础资源与业务指标的全维度监控告警体系(Prometheus+Grafana+Zabbix),配置多渠道告警,告警准确率达95%以上。处理过 Ceph 存储容量水位告警缺失导致的写入异常:定位到 OSD 使用率触发写入保护,紧急扩容并调优 rebalance 参数恢复服务,事后补齐容量水位告警,避免同类故障。
在资源受限环境下搭建 K8s 高可用架构并完成混部部署:双主控制面 + keepalived + nginx 高可用入口,提前规划端口与组件分布。处理过滚动更新后 ingress 80 端口与 Service 端口冲突、集群内部 DNS 解析失败、国产操作系统与 K8s 内核兼容等疑难故障,集群恢复后均沉淀为运维规范。
负责大模型业务的 K8s 容器化部署与推理性能调优。部署 Qwen-32B 推理服务,配置资源隔离避免资源争抢;围绕 KV Cache 显存占比、批处理上限、块大小、多卡并行等参数进行调优,tokens 输出速率提升约 60%;设计多实例部署与健康检查保障高可用,配合监控体系持续观察推理性能。...
搭建覆盖基础资源与业务指标的全维度监控告警体系(Prometheus+Grafana+Zabbix),配置多渠道告警,告警准确率达95%以上。处理过 Ceph 存储容量水位告警缺失导致的写入异常:定位到 OSD 使用率触发写入保护,紧急扩容并调优 rebalance 参数恢复服务,事后补齐容量水位告警,避免同类故障。...
在资源受限环境下搭建 K8s 高可用架构并完成混部部署:双主控制面 + keepalived + nginx 高可用入口,提前规划端口与组件分布。处理过滚动更新后 ingress 80 端口与 Service 端口冲突、集群内部 DNS 解析失败、国产操作系统与 K8s 内核兼容等疑难故障,集群恢复后均沉淀为运维规范。...
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人