该项目面向海外主流内容社区及500+行业垂直站点,解决多站点任务调度、动态页面渲染、复杂访问限制、多语种非结构化内容解析及重复采集问题。我负责分布式增量采集架构和核心模块开发,基于Scrapy-Redis与Scrapyd构建采集矩阵,使用Redis BloomFilter实现亿级URL去重,结合HTTPX、Playwright和DrissionPage完成静态及动态页面采集;通过Kafka削峰并解耦下游清洗入库,使用ScrapydWeb及监控组件完成任务调度、状态监控和异常告警。系统支持日均百万级数据采集,核心站点成功率约95%,形成可扩展、可监控、可恢复的数据采集链路
需求方专属客服,免费梳理匹配