1. 电商平台商品数据采集项目:基于 Scrapy 框架开发分布式爬虫,针对目标平台实现商品信息、价格、库存数据的定时抓取,通过代理池与UA池解决IP封禁问题,将采集数据清洗后存入 MySQL,为竞品分析提供稳定数据源。
2. 公开信息自动化采集项目:使用 Selenium+Playwright 开发动态页面爬虫,模拟用户行为绕过前端渲染与反爬机制,实现目标网站公开数据的自动化抓取、去重与结构化存储,通过定时脚本实现每日增量更新,保证数据时效性。
3. 多平台数据聚合处理项目:整合多个来源的采集数据,使用 Pandas 进行数据清洗、格式转换与多源数据对齐,生成标准化数据报表,支持后续数据分析与可视化,提升数据处理效率与准确性。