Memory的案例列表

作者:Memory · 共 2 个案例

多模型接入网关

参与建设多模型统一接入网关,为上层应用提供统一的 AI 调用接口。主要负责后端接口适配、模型路由、请求鉴权、基础配额控制、调用日志和运行监控,并参与 Linux、Docker 环境部署。系统统一不同模型服务的请求与响应格式,支持流式输出、失败重试和基础用量统计,降低业务侧接入和切换模型的开发成本。

大模型推理优化

参与企业内部大模型推理服务的性能分析与优化。针对推理过程中首Token延迟波动、吞吐不足和显存利用率不稳定等问题,建立固定输入集和压测流程,采集首Token延迟、端到端延迟、Tokens/s、GPU利用率及显存占用等指标。围绕Batch Size、序列长度、KV Cache、并行策略和推理框架配置进行对比实验,并结合运行日志与GPU Profiling定位性能瓶颈,完成部署参数调整和监控补充,沉淀基准测试脚本、配置模板和问题排查文档。

案例判断参考

程序员兼职平台怎么选 程序员平台对比怎么看 企业找程序员外包避坑

Memory的案例列表

多模型接入网关

参与建设多模型统一接入网关,为上层应用提供统一的 AI 调用接口。主要负责后端接口适配、模型路由、请求鉴权、基础配额控制、调用日志和运行监控,并参与 Linux、Docker 环境部署。系统统一不同模型服务的请求与响应格式,支持流式输出、失败重试和基础用量统计,降低业务侧接入和切换模型的开发成本。...

大模型推理优化

参与企业内部大模型推理服务的性能分析与优化。针对推理过程中首Token延迟波动、吞吐不足和显存利用率不稳定等问题,建立固定输入集和压测流程,采集首Token延迟、端到端延迟、Tokens/s、GPU利用率及显存占用等指标。围绕Batch Size、序列长度、KV Cache、并行策略和推理框架配置进行对比实验,并结合运行日志与GPU Profiling定位性能瓶颈,完成部署参数调整和监控补充,沉淀基准测试脚本、配置模板和问题排查文档。...

案例判断参考

程序员兼职平台怎么选 程序员平台对比怎么看 企业找程序员外包避坑
查看简历
微信沟通 客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×