针对开源大模型在业务落地中推理成本高、并发性能差的问题,我负责了模型服务化与后端API的开发。基于 Python + vLLM + TensorRT-LLM 搭建推理引擎,结合 FastAPI 提供高并发异步接口,利用 Kafka 进行请求削峰填谷。设计并实现了动态批处理(Continuous Batching)与显存优化策略,解决了单卡多模型部署时的内存溢出(OOM)问题。最终实现单张A100显卡支持百路并发,整体推理吞吐量提升了3倍,单次调用成本降低了35%。同时基于 Docker + K8s 完成了容器化与自动扩缩容部署。(附图包含:推理平台架构图、GPU显存/利用率监控大盘、K8s部署日志)
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者