AI Agent自动生成并部署爬虫

基本信息

案例ID:246703

技术顾问:Saber - 6年经验 - 浪潮集团

联系沟通

微信扫码,建群沟通

项目名称:AI Agent自动生成并部署爬虫

所属行业:人工智能 - 其他

->查看更多案例

案例介绍

独立开发的AI Agent系统:用户只输入一个列表页网址,Agent自动分析网站结构、生成Scrapy爬虫代码、跑真实数据验证,并自动部署到生产机常驻运行——从一个网址到线上跑起来的爬虫,全链路无人工介入。

Agent四阶段执行:①列表页分析,自动识别SSR渲染、XHR JSON接口、GraphQL、JSONP、内嵌JSON五类数据来源与七种翻页方式,并强制照抄鉴权类自定义请求头(漏抄会导致接口返回合法错误体、爬虫静默抓0条);②详情页分析,XPath候选在原始HTML上批量验证命中数,不用渲染后DOM;③代码生成;④自动验证。

关键架构取舍:不让大模型直接写代码,它只输出结构化SpiderSpec JSON,由确定性模板引擎渲染成代码并做ast语法检查——相同输入必然产出相同代码,从根上消除代码幻觉。

验证不止于"跑通":子进程真实跑两页、落JSONL,除识别403/429/Cloudflare/验证码等反爬信号外,再做字段级质量断言——URL重复率过高、正文中位长度过短、多条正文完全雷同、作者列抓成日期等字段错位,一律判失败,杜绝"抓到了但抓错了"。

自研护栏中间件给Agent上状态机式约束:工具调用配额、重复调用拦截、XPath验证完成后锁死二次探测,解决大模型反复探测页面导致的浏览器崩溃和步数爆炸;MCP工具白名单从29个裁到8个,单步省约5000 token。

验证通过后自动git提交推送、SSH到生产机拉取代码、幂等写入supervisor配置并热更新上线;失败则可在前端直接编辑SpiderSpec或配置反爬参数重跑。

技术栈:LangChain、LangGraph、MCP、DeepSeek/Qwen、FastAPI+SSE流式、React 18+TypeScript、Scrapy+Playwright、Docker、MySQL/SQLite。已为央视新闻、B站、中国日报等15个真实站点生成并验证通过爬虫。

相似案例推荐

其他人才的相似案例推荐

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在1小时内与您联系,1小时内精准确定人才

微信接收人才推送

关注猿急送微信平台,接收实时人才推送

接收人才推送
联系需求方端客服
联系需求方端客服