某金融中心智能文档解析与知识入库项目

人工智能 其他 案例ID:250882
王唯力 Neil Wang
7 年经验· Thoughtworks
微信扫码沟通,客服可协助直接对接工程师;如当前档期不合,也可继续推荐相似案例作者。

案例介绍

因项目原因,作品仅能脱敏展示。

面向全球金融中心的知识服务场景,将多语言、复杂图文 PDF 转为可检索知识,改善保险申报等业务问答的流程识别与操作指引,支持面向个人及企业用户的知识服务。

设计并实现 PDF 结构化解析,结合 OCR、多模态图表理解与专用解析器,处理关系图、计算图和架构图;保留页面坐标、来源及版本,输出适合 chunking 的 Markdown。
建设案例采集与 few-shot 复用机制,实现自动区域识别、解析器路由及语义整理,处理单份约 20–300 页、平均每页约 4 张待解析图的文档。
将人工辅助解析升级为上传后自动生成 Markdown:一阶段人工操作约 10 分钟/页,升级后自动处理平均约 30 秒/页,人工转为抽检与异常处理。
推动四阶段质量评价,亲自实现 Markdown、chunking 与 QA 评分,通过多维量表、核心原则门槛及答案偏好比较定位问题,将上游内容质量与最终回答效果关联。
负责整体方案与交付,协调算法团队完成 chunking / embedding、GraphRAG 检索及图片向量化,统一接口与上下文;提出图关系补充检索和回答携图方案,推进链路集成与优化。
检索召回率由约 60% 提升至 90%;在保险申报场景中改善相似流程混淆,使回答能够给出正确的后续操作指引。

某金融中心智能文档解析与知识入库项目

人工智能 · 其他 案例ID:250882
联系该工程师
微信扫码,建群沟通
作者: 王唯力 Neil Wang - 7年经验- Thoughtworks

案例介绍

因项目原因,作品仅能脱敏展示。

面向全球金融中心的知识服务场景,将多语言、复杂图文 PDF 转为可检索知识,改善保险申报等业务问答的流程识别与操作指引,支持面向个人及企业用户的知识服务。

设计并实现 PDF 结构化解析,结合 OCR、多模态图表理解与专用解析器,处理关系图、计算图和架构图;保留页面坐标、来源及版本,输出适合 chunking 的 Markdown。
建设案例采集与 few-shot 复用机制,实现自动区域识别、解析器路由及语义整理,处理单份约 20–300 页、平均每页约 4 张待解析图的文档。
将人工辅助解析升级为上传后自动生成 Markdown:一阶段人工操作约 10 分钟/页,升级后自动处理平均约 30 秒/页,人工转为抽检与异常处理。
推动四阶段质量评价,亲自实现 Markdown、chunking 与 QA 评分,通过多维量表、核心原则门槛及答案偏好比较定位问题,将上游内容质量与最终回答效果关联。
负责整体方案与交付,协调算法团队完成 chunking / embedding、GraphRAG 检索及图片向量化,统一接口与上下文;提出图关系补充检索和回答携图方案,推进链路集成与优化。
检索召回率由约 60% 提升至 90%;在保险申报场景中改善相似流程混淆,使回答能够给出正确的后续操作指引。

相似案例推荐

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在 1 小时内与您联系确认。

1小时精推人才

需求方专属客服,免费梳理匹配

需求方客服微信二维码
扫码加微信 · 客服人工对接
更多案例
微信沟通 客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×