小卡 Daisy — 桌面 AI 语音助手
项目描述:Windows 桌面 AI 助手,支持语音唤醒、大模型对话与系统操作。后端 FastAPI 提供核心服务,前端通过 LLM 辅助完成界面实现。
个人工作(Python 后端):
设计并实现 FastAPI 微服务架构,包含配置管理、Token 鉴权中间件、WebSocket 双向流式通信
对接豆包 ASR WebSocket 流式识别(自定义二进制协议:4 字节 header + gzip 压缩 + PCM 音频流)
集成 DeepSeek 大模型,实现 JSON Structured Output 解析 + 10 轮对话上下文自动总结压缩
实现 Edge TTS 流式语音合成,设计 Piper 本地 TTS 降级链
搭建指令执行器:白名单校验 → JSON Schema 参数验证 → 系统目录硬编码拦截 → 二次确认,覆盖 8 种操作类型
API Key 通过 Windows DPAPI 加密存储,本地通信使用随机端口 + Token 鉴权
编写完整的 pytest 单元测试
借助 LLM 完成:Electron / React / TypeScript 前端界面、窗口管理、快捷键注册等桌面交互层。
技术栈:FastAPI · WebSocket · Uvicorn · LangChain · DeepSeek · 豆包 ASR · Edge TTS · Windows DPAPI · pytest
基于 RAG 的知识库问答系统
项目简介:设计并实现了一套面向企业内部文档的本地化检索增强生成(RAG)问答系统,支持用户上传txt/pdf格式
文档,通过自然语言提问获取基于文档内容的精准、可溯源回答,解决了传统问答无法引用私有数据、大模型易编造信
息的痛点。
技术栈:Python / LangChain / Ollama / ChromaDB / bge-large-zh / Gradio
技术亮点:全流程管道搭建:使用LangChain LCEL构建模块化RAG管道,串联「文档解析与切分 → 向量检索 → 上下
文拼装 → 大模型生成」全链路,确保回答内容可溯源、有效抑制模型幻觉。
本地化向量引擎实现:部署开源嵌入模型bge-large-zh-v1.5,结合ChromaDB向量数据库实现文档向量化存储与增量
追加,支持多文档累积检索,保障私有数据安全。
交互式Web应用开发:基于Gradio开发双栏Web界面,覆盖文档上传、知识库管理、智能问答全流程,并内置空知识
库校验、文件格式检查、服务状态检测等异常处理机制,提升系统稳定性与用户体验。
项目成果:建成一套可独立运行的本地化RAG问答系统,上传文档后即可基于文档内容进行问答,回答附带引用来源,
支持多文档累积检索,可快速落地企业内部知识问答场景。