【Joker — 恋爱关系认知校准官 | LangGraph 多 Agent 系统】
独立设计并开发了一个基于 LangGraph 的多节点认知分析管线,核心目标是将关系中"猜对方在想什么"从直觉黑箱变为可检查、可反证、可校准的结构化流程。
技术架构:8 个独立节点组成完整管线——preprocess(文本拆解为 claims)、signals(行为信号提取与量化评分)、supervisor(纯代码路由,不依赖 LLM 决策)、evidence(证据收集与 credit_score 计算)、alternative(替代解释生成与 claim 类型判定)、info_symmetry(信息对称性检查)、contradictory(弱证据与替代解释缺口汇总)、summary(三段结构诊断,写入长期记忆)。所有节点通过 StateGraph 条件路由串联。
核心技术决策:① 采用 JSON-only 输出模式替代 Function Calling,通过三层 fallback 解析(json.loads → 正则提取代码块 → 首尾花括号匹配)解决 DeepSeek tool_calling 不稳定的问题;② 设计 Checklist 模式——LLM 只做定性选择题(如"ta 的回应是 A/B/C/D?"),代码按映射表做定量计算,避免 LLM 直接拍数字的不可靠性;③ 三层输出防御:Prompt 约束 → 代码校验(setdefault 补齐 + 类型校验 + 范围裁剪) → retry_hint 将失败原因注入下一轮。
记忆系统:双层架构——MemorySaver 管理单会话多轮状态,SqliteStore 持久化跨会话长期记忆(用户 profile + 关系时间线),手动控制读写时机。
RAG 知识增强:内置 10 张心理学理论卡片(确认偏误、认知失调、情绪推理、依恋理论等),BGE-base-zh-v1.5 嵌入 → numpy 余弦相似度检索。检索时区分嵌入字段与不嵌入字段,避免 common_misinterpretations 的否定语义污染向量方向。
评估体系:10 个 golden dataset 场景(easy/medium/hard),从 RAG Recall、结构完整性、LLM 裁判覆盖度、正确性 MCQ 四个维度打分,加权总分从初始 0.52 优化至 0.84。
全栈交付:Gradio 6 前端 + FastAPI 后端 + DeepSeek-chat (T=0) 模型,已部署线上 Demo。