AiAgent
所在智慧运维部门已有 APM 调用链、服务拓扑、指标与告警等产品积累;在此基础上建设故障诊断与恢复 Agent,覆盖业务平台、云平台和云 PaaS,推动运维能力由固定工作流向目标驱动的诊断处置闭环演进。
• 划分 Java 与大模型职责:Java 服务查询 MySQL/ClickHouse 指标和告警,完成窗口统计、阈值判断及结构化诊断;大模型负责理解故障诉求、聚合专业诊断结果并生成根因报告和处置建议。
• 设计 RAG 检索链路,以结构化诊断结果构造知识查询上下文,匹配运维知识库中的相关内容和恢复手段;结合 APM 服务拓扑分析上下游影响范围,为 Agent 输出根因、影响评估和处置建议提供专业上下文。
• 将拨号、钉钉、企业微信通知及故障恢复、Pod 重启等能力封装为 Agent Skills;定位完成后由 Agent 通知负责人,高风险操作经人工确认后执行,并记录任务状态和执行结果,形成诊断、通知、确认、处置和验证闭环。
• 典型问题与解决:工作流同步调用诊断接口时出现超时,改造为 SUBMIT/QUERY 异步任务模式,以独立线程池执行并持久化 RUNNING、SUCCESS、FAILED 状态,基于 workflowRunId 防止重复提交。经验:耗时不可控的 Agent 和外部 Skill 应采用任务化、幂等键、状态持久化及人工审批点解耦。
基于 Kafka 的分布式任务流处理系统(星邺汇捷) | 架构与开发
技术环境:Spring Boot、Spring Cloud、Kafka、MySQL、ClickHouse、Nacos、Docker、Kubernetes
• 采用 Consumer 与 Executor 分离设计,基于注解和方法名实现任务处理器自动注册与路由,降低新增任务类型的接入成本。
• 典型问题与解决:消费速度高于任务执行能力时,线程池和内存存在积压风险;通过信号量限制并发,在容量不足时控制新任务进入,配合状态跟踪、手动 offset 和优雅停机降低重复处理或任务丢失风险。经验:消费端拉取能力必须与执行器容量联动,可靠性还需要幂等和可追踪状态共同保障。
• 实现手动 offset 管理、任务状态记录、超时与重试控制;通过统一关闭管理器协调消费者和线程池,降低停机过程中的任务丢失风险。
• 支持 MySQL、ClickHouse、Oracle、PostgreSQL、Informix 等数据源,并扩展 Kafka、数据库及邮件/Word 报告等结果输出方式。
企业级工作流引擎系统(星邺汇捷) | 后端开发
技术环境:Spring Boot、Camunda BPM、MyBatis-Plus、MySQL、Quartz、WebSocket、Nacos、Kubernetes
• 典型问题与解决:流程引擎与 Spring Bean 初始化时序不一致,导致自定义服务注入失败;通过 ProcessEnginePlugin 的 preInit/postInit 生命周期完成扩展和依赖注入。经验:深度扩展第三方框架时,应优先遵循其生命周期和扩展点,避免依赖普通 Bean 初始化顺序。
• 按流程、框架和字典业务拆分数据源与本地事务边界,避免将多库操作误纳入单一事务;对跨库流程采用明确的调用顺序和异常处理。
• 实现任务创建/完成节点的 WebSocket 消息推送,支持单用户多连接、定向及广播推送。
• 优化驳回场景的历史节点过滤,开发嵌套 JSON 表单字段重复校验、数据脱敏及 Quartz 自动解挂任务。