独立开发的AI Agent系统:用户只输入一个列表页网址,Agent自动分析网站结构、生成Scrapy爬虫代码、跑真实数据验证,并自动部署到生产机常驻运行——从一个网址到线上跑起来的爬虫,全链路无人工介入。
Agent四阶段执行:①列表页分析,自动识别SSR渲染、XHR JSON接口、GraphQL、JSONP、内嵌JSON五类数据来源与七种翻页方式,并强制照抄鉴权类自定义请求头(漏抄会导致接口返回合法错误体、爬虫静默抓0条);②详情页分析,XPath候选在原始HTML上批量验证命中数,不用渲染后DOM;③代码生成;④自动验证。
关键架构取舍:不让大模型直接写代码,它只输出结构化SpiderSpec JSON,由确定性模板引擎渲染成代码并做ast语法检查——相同输入必然产出相同代码,从根上消除代码幻觉。
验证不止于"跑通":子进程真实跑两页、落JSONL,除识别403/429/Cloudflare/验证码等反爬信号外,再做字段级质量断言——URL重复率过高、正文中位长度过短、多条正文完全雷同、作者列抓成日期等字段错位,一律判失败,杜绝"抓到了但抓错了"。
自研护栏中间件给Agent上状态机式约束:工具调用配额、重复调用拦截、XPath验证完成后锁死二次探测,解决大模型反复探测页面导致的浏览器崩溃和步数爆炸;MCP工具白名单从29个裁到8个,单步省约5000 token。
验证通过后自动git提交推送、SSH到生产机拉取代码、幂等写入supervisor配置并热更新上线;失败则可在前端直接编辑SpiderSpec或配置反爬参数重跑。
技术栈:LangChain、LangGraph、MCP、DeepSeek/Qwen、FastAPI+SSE流式、React 18+TypeScript、Scrapy+Playwright、Docker、MySQL/SQLite。已为央视新闻、B站、中国日报等15个真实站点生成并验证通过爬虫。