杂乱文本、扫描版 PDF、图片里的联系人、发票、销售线索,人工录入费时费力还容易出错。
我开发了一个 AI 驱动的信息抽取工具 :把非结构化文档一键转换成干净、经过格式校验的结构化数据,每个字段带置信度评分和实时成本统计。
核心功能
- 预置场景开箱即用:联系人 / 发票 / 销售线索三类抽取模板(字段中英文双语显示)
- 自定义数据结构:可自定义字段,也支持 AI 从一份样例文档自动推断 Schema
- 字段级置信度:每个抽取字段带 0–1 置信分,空值自动置 0,低置信数据一眼可辨
- 自动格式校验:邮箱 / 电话 / URL / ISO 日期通过「格式 → 校验器」注册表动态挂载
- 实时成本追踪:单次抽取的 token 用量与 USD 成本,批量任务自动汇总
- 多格式输入:纯文本、PDF(文本层 + 逐页 OCR 兜底,支持扫描件 )、图片(PNG/JPEG/BMP 视觉 OCR)
- 批量并发处理:并发限制器控制速率,单条失败不影响整批,部分结果保留
- 双语 Web 界面(中/英)、最近 20 次任务历史一键恢复、JSON / Excel 导出 (结果 + 置信度双 sheet)
我的角色 :独立开发者,全栈完成——架构设计(严格单向分层的模块依赖)、后端、前端、CLI、测试与 Render 部署。
技术栈与质量
- 后端:FastAPI + Pydantic-AI Agent(temperature=0),动态 Pydantic 模型按 Schema 实时生成;支持 DeepSeek / OpenAI 等多模型切换
- 前端:React + TypeScript,中英双语
- 200+ 测试全部离线运行(TestModel 模拟 LLM),API 成本为零;TDD 全程红-绿-重构
- Render 单服务部署,冷启动一次
关键词 :LLM 应用开发 / AI 信息抽取 / 结构化数据 / PDF 解析 / OCR / 发票识别 / 名片录入 / 数据清洗 / FastAPI / Pydantic / React
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者