项目一:企业级AI知识库系统(RAG)架构设计与落地
2022.10 - 2026.03|海量数据|AI架构负责人
架构挑战:
公司统一技术平台需构建私域技术知识库,面临三重架构矛盾:
(1)传统ES全文检索无法理解运维领域术语的语义关联;
(2)纯向量检索在精确匹配场景召回不足;
(3)大模型生成存在事实性幻觉风险。
架构方案:
检索层:设计混合检索架构,ES8负责元数据过滤+BM25关键词精确匹配 + Milvus(向量相似度)负责语义泛化召回,双路召回互补,解决单一检索模式的召回盲区;
精排层:引入BGE Rerank模型对召回结果重排序,过滤低质量上下文,提升生成输入的准确性;
生成层:通过CloseAI接入GPT-4o/Qwen3.5-plus/DeepSeek-V3.2,设计Prompt模板与生成边界约束机制;
治理层:建立RAG效果评估流水线(准确率/幻觉率/延迟),持续优化Embedding模型与Chunk策略。
架构价值:
复杂问答准确率从72%提升至91%,幻觉率从15%降至4%;作为平台级组件支撑10+业务线接入,避免各业务线重复建设。
项目二:智能运维Agent系统架构设计与工程化
2023.06 - 2026.03|海量数据|AI架构负责人
架构挑战:
传统运维依赖人工排查,响应慢、误操作风险高;需构建具备"理解-推理-执行-记忆"闭环能力的智能运维助手,且需满足生产级稳定性与低延迟要求。
架构方案:
推理架构:基于ReAct设计多轮对话Agent架构,集成知识库检索、FunctionCall工具编排(集群管理API、蓝鲸workflow修复脚本)与人工确认机制,确保关键操作可控;
记忆架构:引入对话记忆管理层与长期上下文窗口优化,支持跨会话状态保持与历史上下文回溯;
韧性架构:设计模型路由降级与异常自愈机制,应对模型服务异常与工具调用失败,保障系统持续可用;
架构价值:
生产级运维任务完成率85%,平均响应延迟P99<<2s;保障AI服务99.9% SLA,全年0重大故障。
项目三:PaaS统一技术云平台与AI中间件体系架构
2022.10 - 2026.03|海量数据|后端技术经理 / AI架构负责人
架构挑战:
支撑全公司上万条业务线服务、中间件、数据库统一部署运维,需屏蔽虚拟机/K8s集群/公有云等底层差异;同时需将AI能力(LLM推理、向量存储、检索)平台化,让业务线快速接入。
架构方案:
基础设施层:基于蓝鲸平台流水线开发部署脚本,基于K8s API提供容器化部署能力,屏蔽底层基础设施差异;
中间件层:治理Redis、Pulsar、Elasticsearch、Kafka、ELK等100+中间件集群,设计主从/哨兵/集群/分布式多模式部署方案,建立监控巡检与故障告警机制;
日志架构层:基于Filebeat、Loggie、Kafka、ELK构建统一日志采集体系(日百亿级),优化采集配置、分流策略、索引生命周期、冷热分层、分片规划与检索参数,保障日志实时可查;
AI中间件层:将vLLM推理、Milvus向量存储、ES8检索封装为标准化平台组件,提供开箱即用的AI服务能力。
架构价值:
上万条业务线快速接入统一平台,资源使用量降低70%;ES集群写入达5万条/秒,Kafka集群日10亿级消息治理;支撑数据分析团队与算法团队可视化部署AI组件。