1. 企业级 DataAgent 数据智能问答系统
参与企业级数据库智能问答系统的研发和落地,面向高校一卡通、缴费、门禁等复杂业务数据库,实现用户自然语言问题到业务数据结果的完整执行链路。主要负责意图识别、问题改写、候选表召回、Schema Linking、表字段选择、SQL 生成、数据库执行、失败纠错及结果解释等模块。
针对传统 ReAct 多步骤执行速度慢、模型调用成本高和结果不稳定的问题,参与设计 NL2SQL 短链路和任务经验复用机制。通过向量召回、关键词召回、Rerank 和大模型选表提升候选表准确率;对高置信度历史任务复用 SQL 模板、字段合同和执行路径,对人物、日期等历史参数进行动态替换。建立 SQL 执行失败后的定向修正机制,并通过评测集持续分析错误类型、补充表字段描述和业务枚举,提高系统在真实业务问题中的准确率与稳定性。
技术栈:Python、FastAPI、Oracle、MySQL、PostgreSQL、Milvus、MongoDB、Pandas、LLM API、Docker。
2. 数据库语义理解与表描述生成平台
开发面向数据智能体的数据库语义理解和元数据治理工具,支持 Oracle、MySQL 等数据源。系统可自动读取表、字段、主键、唯一索引、普通索引、外键、记录数量及少量样例数据,并在脱敏后调用大模型生成表级描述、字段描述、数据粒度、业务标识、时间字段和关联关系。
设计全库目录图和邻居上下文机制,避免模型逐表孤立分析;支持数据源级关系语义模型,对候选关系进行人工确认、拒绝、发布、版本管理和回滚。实现批量生成任务、单表失败隔离、任务状态持久化、中断恢复、调用重试、限流、内容复用及 DataAgent 元数据导出。针对敏感数据场景增加隐私模式,可关闭业务数据采样、清除默认值并对用户输入中的数据字面量进行替换。
该项目能够用于数据库文档补全、数据资产梳理、数据智能体建设前的元数据治理,以及自然语言查询数据库项目的前期准备。
技术栈:Python、FastAPI、SQLAlchemy、Oracle、MySQL、SQLite、LLM API、HTML、JavaScript、Pytest。
3. RAG 与智能体长期记忆系统
参与设计和重构智能体长期记忆系统,将原有简单向量记忆升级为结构化 Wiki 记忆。系统包含事实抽取、待处理队列、文档归类、知识块生成、原始事实留存、写入事件记录和查询召回等完整流程。
在写入阶段,将对话或执行结果抽取为原子事实,并由大模型判断其所属文档和章节;在召回阶段,根据用户问题选择候选知识文档,按章节或全文检索,再通过评分过滤和重排序返回上下文。针对大体量文档合并失败、知识写入成功但召回为空等线上问题,完成日志分析、MongoDB 集合检查、召回链路定位和分块策略优化,并设计可回溯目录和禁用高风险合并的降级方案。
该系统用于沉淀用户偏好、业务口径、数据库知识、历史任务经验和执行结论,为后续回答、SQL 生成和报告生成提供长期上下文。
技术栈:Python、MongoDB、SQLite、向量检索、Rerank、LLM API、Docker。
4. 数据处理、数据库兼容与部署运维
负责多个 AI 数据应用的服务器部署、容器化和线上排障工作。处理过旧版本 Oracle 数据库驱动不兼容问题,将连接模式由 Thin 改造为 Thick,统一 Agent 查询、连接测试和 NL2SQL 等多个数据库入口,并将 Oracle Instant Client 集成至 Docker 镜像,通过环境变量控制不同运行模式。
搭建并维护 Docker Compose 环境,涉及应用服务、MongoDB、Qdrant 等组件;能够完成镜像构建、推送、服务器部署、环境变量挂载、容器健康检查和日志定位。针对大结果集查询设计 DuckDB、Parquet、Zstd 流式落盘方案,在扩展不可用时自动降级至 Pandas 与 PyArrow,并通过结果行数、JOIN 和子查询复杂度限制降低内存溢出风险。
同时具备服务器网络、Tailscale 异地组网、DERP 中继诊断、远程访问和 Windows 服务排查经验,可承接开源 AI 项目部署、模型 API 接入、数据库连接故障和容器运行异常等任务。
技术栈:Linux、Docker、Docker Compose、Oracle Instant Client、Nginx、Git、MongoDB、Qdrant、DuckDB、Pandas、PyArrow。
5. 独立工具与轻量应用开发
独立开发过多款 Windows 桌面工具和轻量 Web 应用。其中包括 W