使用技术:
1. 使用Scrapy_Redis搭建分布式爬虫框架
2. 使用 Re+XPath+Jsopath提取数据
3. 使用js2py或者pyv8来执行js相关代码,获取数据。
4. js环境比较复杂,无法完全找到js包,那么可以使用selenium配合浏览器,使用driver执行js代码,获取相关数据
5. 使用 Selenium+Headless Chrome无头浏览器爬取页面数据
6. 使用nodejs实现淘宝的自动登录
7. 使用elasticsearch保存数据 便于搜索查询数据
项目一:淘宝系网站相关爬虫
爬取阿里系的各类商家服务网站的数据,需要商家的账号登录。
项目二:淘宝自动登录
使用puppeteer进行自动登录操作,批量登录淘宝商家账号,并获取淘宝商家后台、直通车、钻展、超级推荐等网站的登录信息,为数据爬取提供支持