中医药领域 LLM Benchmark 构建与多模型性能对比研究 2025.9 – 2026.1
第一作者 | Python · LangChain · RAG · NLP 数据工程
•基准构建:设计 NLP 提取管道(正则匹配 + LLM 校验双层过滤)对中医古籍进行数据清洗,构建含 600+ 高难度 Q&A 基准,覆盖诊断、药方及古籍理解三大类别,数据噪声率低于 3%。
•RAG 优化:针对300c同源异质300d古籍数据难题,设计带元数据过滤(朝代、文献类型)与 BGE-Reranker 语义重排的两阶段检索方案;构建 Milvus 专业知识库(10 万+ 文本块),Top-5 召回率提升 28%,通过 RAG 使模型综合评测得分提升 20%。
•评测体系:设计涵盖【事实准确性、逻辑推理、安全合规】三维评测指标,系统对比 GPT-4o、Qwen2.5-72B 等 6 款前沿模型,产出评测报告并撰写一作学术论文(在投)。
高难度数学推理任务的 LLM 测试时扩展优化与评测 2025.7 – 2025.9
第一作者 | Python · vLLM · LoRA/QLoRA · LangChain
•模型微调:使用高质量数学推理数据集(MATH / NuminaMath),采用 QLoRA(4-bit 量化)对 Qwen3-8B 进行 SFT 训练,在 A100×4 环境下完成训练,MATH 基准得分提升 4.2 个百分点。
•评测管线:基于 vLLM 在 8×24GB 显卡集群搭建高吞吐自动化评测管线(吞吐量 180 req/s),量化 Scaling 性能边界;设计多路径采样(Best-of-N)与自我验证策略,推理准确率最高提升 3%,总 Token 消耗减少 80%。
产出一作学术论文(在投),相关代码已整理为可复现实验框架。
锐捷网络——多模态 AI 互动式教学智能体 2026.2 – 至今
核心成员 | LangGraph · Dify · RAG · Vision LLM
•Agent 编排:基于 LangGraph 设计「规划-答疑-评估」多角色 Multi-Agent 协作拓扑,通过状态流转实现任务拆解与闭环交互,支持 100+ 并发学生会话。
•RAG 与多模态:基于 Dify 部署 RAG 链路,实现教材文档切片(按知识点边界分块)与混合检索,答题幻觉率下降 55%;设计基于意图路由的 Vision/Text 模型联合调度,支持图形题自动解析。
•逻辑强化:构建深度 Prompt Pipeline,引入多步 CoT + Self-Reflection 机制,模型解题拆分正确率提升 30%。