1. Cnblogs - 博客园爬虫
使用Urllib库实现博客园"最新文章"的爬取,可以自行扩展为全站爬虫,但是要注意它的接口。
2.Moments - 朋友圈爬虫
基于自动化测试工具Appium的微信朋友圈爬虫,模拟登录、抓取动态、保存数据。
3.Bilibili - B站爬虫
模拟登录B站并识别滑动验证码。破解滑动验证码的思路主要沿袭崔大破解极验的思路,登录、获取验证码Image对象、打码平台识别、本地转化识别结果、Selenium模拟滑动等。
4.DouYin - 抖音爬虫
基于Mitmdump的抖音短视频爬取,包括视频名称、作者名称、获赞数、转发量等重要信息的获取。
5.Crack_Jianshu - 简书爬虫
为了照顾简书,完成了简书的模拟登录并识别简书的点触式验证码,破解验证码的思路基本与滑动验证码相同。
6.Selenium_163 - 网易163邮箱爬虫
模拟登录网易163邮箱,并发送SOS邮件。主要是为了对iframe子节点的训练。
7.City_58 - 58房屋信息爬虫
使用Scrapy框架爬取58同城的出租房信息,并包含下级网页数据的爬虫,项目难度较大,可根据能力练习。