RAG 引擎与自动化评测平台

人工智能 其他 案例ID:251740
Louis
6 年经验· 润建股份
微信扫码沟通,客服可协助直接对接工程师;如当前档期不合,也可继续推荐相似案例作者。

案例介绍

面向企业级 RAG 应用落地中“效果不可量化、问题无法定位”的核心痛点,从零独立完成的可评测、可归因 Agentic RAG 引擎。
区别于只交付“一个能问答的系统”,本项目交付的是“一个能告诉你哪里坏了的系统”:通过全链路 Trace 记录每一次检索的候选池与最终入选结果,构建归因决策树,把 badcase 自动定位到「分块/召回/重排/生成」四个环节之一,使 RAG 应用上线后的效果优化从“凭经验试”变为“按数据改”。
系统支持私有化部署与内网离线交付,可直接作为企业知识库问答的应用底座,适配电力、政务、制造等对数据安全有要求的行业场景。
独立开发​,从架构设计、编码、评测集构建到实验验证全部由本人完成:
应用服务化交付:FastAPI 提供 SSE 流式问答接口,答案强制携带文档来源与原文段落定位;Redis 语义缓存(0.93 相似度阈值)降低高频问题延迟;Docker Compose 一键部署,支持内网离线环境整包交付
检索链路工程:父子分块(子块 384 字保召回精度、回溯父块 1536 字保上下文完整)+ 向量与 BM25 双路召回 + RRF 融合 + bge-reranker 精排;4 种分块策略与 3 种检索模式配置化切换;增量更新基于内容 hash 比对,改一份文档无需全量重建索引
Agentic 能力:Query Router 对问题做 0/1/多跳分类并按需改写 query,多跳问题走 ReAct 循环(检索→证据充分性判断→改写→再检索),把高成本的多跳能力只用在需要的地方
评测与归因(核心)​:从语料反向生成带 gold 标注的评测集(含多跳题与拒答题),基于 LLM-as-Judge 计算忠实度、答案相关性、上下文召回率/精确率;基于全链路 Trace 构建归因决策树,并用故障注入构建已知根因的验证集检验归因准确率

RAG 引擎与自动化评测平台

人工智能 · 其他 案例ID:251740
联系该工程师
微信扫码,建群沟通
作者: Louis - 6年经验- 润建股份

案例介绍

面向企业级 RAG 应用落地中“效果不可量化、问题无法定位”的核心痛点,从零独立完成的可评测、可归因 Agentic RAG 引擎。
区别于只交付“一个能问答的系统”,本项目交付的是“一个能告诉你哪里坏了的系统”:通过全链路 Trace 记录每一次检索的候选池与最终入选结果,构建归因决策树,把 badcase 自动定位到「分块/召回/重排/生成」四个环节之一,使 RAG 应用上线后的效果优化从“凭经验试”变为“按数据改”。
系统支持私有化部署与内网离线交付,可直接作为企业知识库问答的应用底座,适配电力、政务、制造等对数据安全有要求的行业场景。
独立开发​,从架构设计、编码、评测集构建到实验验证全部由本人完成:
应用服务化交付:FastAPI 提供 SSE 流式问答接口,答案强制携带文档来源与原文段落定位;Redis 语义缓存(0.93 相似度阈值)降低高频问题延迟;Docker Compose 一键部署,支持内网离线环境整包交付
检索链路工程:父子分块(子块 384 字保召回精度、回溯父块 1536 字保上下文完整)+ 向量与 BM25 双路召回 + RRF 融合 + bge-reranker 精排;4 种分块策略与 3 种检索模式配置化切换;增量更新基于内容 hash 比对,改一份文档无需全量重建索引
Agentic 能力:Query Router 对问题做 0/1/多跳分类并按需改写 query,多跳问题走 ReAct 循环(检索→证据充分性判断→改写→再检索),把高成本的多跳能力只用在需要的地方
评测与归因(核心)​:从语料反向生成带 gold 标注的评测集(含多跳题与拒答题),基于 LLM-as-Judge 计算忠实度、答案相关性、上下文召回率/精确率;基于全链路 Trace 构建归因决策树,并用故障注入构建已知根因的验证集检验归因准确率

相似案例推荐

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在 1 小时内与您联系确认。

1小时精推人才

需求方专属客服,免费梳理匹配

需求方客服微信二维码
扫码加微信 · 客服人工对接
更多案例
微信沟通 客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×