负责大模型业务的 K8s 容器化部署与推理性能调优。部署 Qwen-32B 推理服务,配置资源隔离避免资源争抢;围绕 KV Cache 显存占比、批处理上限、块大小、多卡并行等参数进行调优,tokens 输出速率提升约 60%;设计多实例部署与健康检查保障高可用,配合监控体系持续观察推理性能。
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者