面向品牌 GEO(生成式引擎优化)分析的多平台 AI 答案采集系统,本人负责采集引擎、调度与交付链路的全部开发。系统覆盖豆包、通义千问、DeepSeek、腾讯元宝四个主流 AI 平台,批量投放问题并采集回答正文、引用信源、模型版本、联网状态与逐屏截图。
架构上把浏览器与采集进程分离:每个账号一个独立 Docker 容器,内跑真实 Chrome(虚拟屏 + 软件渲染),采集端通过 CDP 远程接管,登录态持久化在独立数据卷,单账号被风控不影响其他通道。共 12 条采集通道(4 平台 × 3 账号),平台间并行、同平台账号串行。
调度以任务矩阵为核心(问题 × 平台 × 账号 × 轮次)落库,支持多轮次定时复采、断点续跑与失败退避重试,进程重启不丢进度。
反爬与风控处理是重点:请求间隔带随机抖动(等距请求本身就是机器特征)、每采若干条长休息、浏览器定期主动回收;能识别图形验证码与限流页面,并针对目标平台验证码文案中不含任何提示性关键词的情况,额外做了连续失败熔断兜底,任何说不清的连续异常都会停下该通道并告警,而不是静默跑完。命中后该通道原地暂停并推送通知(页面告警 + webhook),人工远程处理完自动恢复采集,其余平台全程不受影响。
数据侧遵循原始优先原则:先落原始响应体再解析,解析规则调整后可离线重算全量,无需重新采集;并坚持 fail-closed,状态非成功的结果绝不当作有效回答进入交付物,失败格子在交付表中明确标注原因,避免出现看着完整、实则有洞的数据。
交付自动产出信源追踪表(xlsx)、问答原文(JSON)、双表 CSV 与逐条回答截图 PDF,打包为单个压缩包。单批次可稳定完成 400 条以上采集任务。技术栈:Python、Playwright、CDP、Docker Compose、SQLite、asyncio、Web 控制台(标准库实现,零前端依赖)。
作品名称:企业 ERP 系统 UI 重构与前端框架 所属行
基于开源 MrDoc 在线文档系统进行二次开发,打造面向企业
项目基于浏览器 HAR 数据采集用户真实操作行为,对接口请求
基于企业级 RPA 客户端开发内容运营与营销获客自动化能力,
本人从零开发的价格监控与数据看板 MVP,不依赖第三方框架。
本项目为前后端全栈开发的图书馆管理系统,后端基于Java+S
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者