ArticleCrawler 是一个用 Python 编写的增量式新闻聚合爬虫项目,基于 Scrapy 框架和 APScheduler 定时调度器构建。它内置了超过 10 个站点的爬虫模块,通过自定义的 SunSpider 基类实现 URL 自动去重,借助 curl_cffi 模拟浏览器指纹来应对反爬机制。项目支持图片本地化下载与 HTML 替换、JSON 文件输出和 MySQL 数据库持久化。
需求方专属客服,免费梳理匹配