参与建设多模型统一接入网关,为上层应用提供统一的 AI 调用接口。主要负责后端接口适配、模型路由、请求鉴权、基础配额控制、调用日志和运行监控,并参与 Linux、Docker 环境部署。系统统一不同模型服务的请求与响应格式,支持流式输出、失败重试和基础用量统计,降低业务侧接入和切
参与企业内部大模型推理服务的性能分析与优化。针对推理过程中首Token延迟波动、吞吐不足和显存利用率不稳定等问题,建立固定输入集和压测流程,采集首Token延迟、端到端延迟、Tokens/s、GPU利用率及显存占用等指标。围绕Batch Size、序列长度、KV Cache、并行
扫码添加客服极速匹配,或直接发布需求让更多人才主动报名
基于 35,336 需求方信任
鼠标悬停或点击上方资质图片,可放大右下角二维码进行扫码验真。
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人
收藏后可在“我的收藏”里统一查看,也方便后续继续联系和筛选合适人才。
登录后将自动返回当前页,继续浏览不会丢失。