1、AI Agent 自动生成并部署爬虫系统(独立开发):用户只输入一个列表页网址,Agent 自动分析网站数据来源与翻页机制、生成 Scrapy 爬虫代码、跑真实数据验证,并自动 git 推送、SSH 部署到生产机由 supervisor 常驻运行。核心设计是不让大模型直接写代码,它只输出结构化 SpiderSpec,由确定性模板引擎渲染,从根上消除代码幻觉;验证环节除识别 403/429/验证码等反爬信号外,还做字段级质量断言,杜绝"抓到了但抓错了"。已为 15 个真实站点生成并验证通过。技术栈:LangChain / LangGraph / MCP / Scrapy / FastAPI / React。
2、多平台 AI 答案采集系统:面向 GEO(生成式引擎优化)场景,在 Docker 中并行调度 12 条采集通道,同时从 4 个主流 AI 对话平台按题采集回答并结构化交付。原始响应体先落盘再解析,解析器升级后可离线重算历史数据;fail-closed 状态机保证异常结果绝不当作有效数据交付;内置请求节流抖动、长休息、浏览器定期回收、风控熔断与人工介入恢复机制。
3、基于大模型的智能数据采集与结构化 ETL 系统:针对研报网、企查查等高风控站点,用 Playwright + 代理池稳定获取底层数据,再把清洗后的杂乱网页文本交由开源大模型直接转为业务所需的标准 JSON,替代脆弱的 XPath / 正则。新增站点的解析规则开发时间从 1 天缩短至 1 小时,解决了目标站前端频繁改版导致的数据断流。
4、GAW-Scraper 通用高并发异步爬虫框架:从 0 到 1 主导设计,底层基于 asyncio 的生产者-消费者协程并发模型,纯 JSON 配置驱动,下发目标 URL 与策略即可自动调度;框架层集成指纹伪装、动态 IP 代理池轮询与 Cookie 自动保活中间件。单节点日均稳定并发采集原始网页 200 万+ 次,新站点接入配置时间缩短 80%。
5、行业资讯 RAG 检索与舆情问答知识库:FastAPI + Qwen / DeepSeek + Milvus + BGE Embedding,引入 BM25 与向量双路召回,解决企业名称、行业黑话在纯向量检索中丢失的问题。内部资料检索平均耗时缩短约 60%,搜索准确率较传统 ES 方案提升约 30%。