大模型推理优化

人工智能 其他 案例ID:248969
Memory
5 年经验· 滴滴出行
微信扫码沟通,客服可协助直接对接工程师;如当前档期不合,也可继续推荐相似案例作者。

案例介绍

参与企业内部大模型推理服务的性能分析与优化。针对推理过程中首Token延迟波动、吞吐不足和显存利用率不稳定等问题,建立固定输入集和压测流程,采集首Token延迟、端到端延迟、Tokens/s、GPU利用率及显存占用等指标。围绕Batch Size、序列长度、KV Cache、并行策略和推理框架配置进行对比实验,并结合运行日志与GPU Profiling定位性能瓶颈,完成部署参数调整和监控补充,沉淀基准测试脚本、配置模板和问题排查文档。

大模型推理优化

人工智能 · 其他 案例ID:248969
联系该工程师
微信扫码,建群沟通
作者: Memory - 5年经验- 滴滴出行

案例介绍

参与企业内部大模型推理服务的性能分析与优化。针对推理过程中首Token延迟波动、吞吐不足和显存利用率不稳定等问题,建立固定输入集和压测流程,采集首Token延迟、端到端延迟、Tokens/s、GPU利用率及显存占用等指标。围绕Batch Size、序列长度、KV Cache、并行策略和推理框架配置进行对比实验,并结合运行日志与GPU Profiling定位性能瓶颈,完成部署参数调整和监控补充,沉淀基准测试脚本、配置模板和问题排查文档。

相似案例推荐

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在 1 小时内与您联系确认。

1小时精推人才

需求方专属客服,免费梳理匹配

需求方客服微信二维码
扫码加微信 · 客服人工对接
更多案例
微信沟通 客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×