大模型:主导金融研报分析平台,设计混合检索RAG(稠密+稀疏+重排序)及多Agent协作(规划、检索、摘要、核查),微调Qwen-72B并使用DeepSpeed分布式训练。系统准确率达92%,推理延迟控制在2秒内,已服务近百位分析师。
机器视觉:负责电子元件缺陷检测系统,基于RT-DETR和YOLOv8优化小目标召回,引入Focal Loss解决样本不均衡,经TensorRT部署至边缘设备。推理速度30 FPS,mAP达98.3%,上线后产线良率提升15%。
多模态与工程部署:搭建统一推理服务平台,融合CLIP与LLaMA实现图文生成和视觉问答,采用vLLM和Triton实现高吞吐调度,PagedAttention技术提升3倍吞吐,K8s弹性伸缩管理,日均处理请求超10万次,稳定运行6个月。