核心技术栈: Python, LangChain, LangGraph, LLM, Agent, Docker, FastAPI, MySQL, , Qdrant,Elasticsearch
1. 项目背景与目标
针对传统 BI 工具使用门槛高、业务人员获取数据依赖开发排期的痛点,主导研发了“掌柜问数”智能分析平台。该项目基于 LLM + Agent 架构,旨在打破自然语言与底层数据库的交互壁垒,实现“对话即分析”,大幅降低企业数据获取门槛,提升决策效率。
2. 核心职责与技术亮点
构建动态元数据知识库与混合检索体系:
设计了以 MySQL 为核心存储的结构化元数据中心,涵盖 metric_info(指标定义)、table_info(表结构)、column_info(字段语义)等实体。
引入 Qdrant 构建语义向量索引,结合 Elasticsearch 构建全文索引,形成“结构化+非结构化”的双重索引体系。
支持知识库实时维护与热更新:开发了元数据同步机制,当底层数据库 Schema 变更或业务指标调整时,系统能自动或手动触发增量更新,确保 Agent 始终基于最新的表结构和业务定义生成 SQL,解决了模型知识滞后导致的查询失败问题。
基于 LangGraph 的复杂 Agent 编排:利用 LangGraph 设计了有向图工作流,实现了从“意图识别”到“多路召回(字段/指标/值)”,再到“信息合并与过滤”的精细化控制。通过动态注入最新的数据库元数据(Schema、注释)构建上下文,使大模型具备对业务数据结构的“全局认知”。
Prompt 工程与 SQL 生成优化:
在 Prompt 中引入 Few-Shot(少样本学习) 与动态业务术语字典,有效解决了大模型在复杂多表关联查询中的字段幻觉与语法错误问题。设计了“生成-执行-纠错”的闭环反馈机制。当 SQL 执行报错时,Agent 能够自动捕获异常信息,结合原始问题让 LLM 进行自我反思与 SQL 修正,提高了系统的鲁棒性。
全链路流式交互与可观测性:
基于 FastAPI 与 SSE 技术,实现“用户提问 → Agent 思考 → SQL 生成 → 数据查询 → 结果总结”的全+链路流式响应。用户可实时感知系统的执行进度(如正在查表、正在计算),极大提升了交互体验。
需求方专属客服,免费梳理匹配