定时爬虫项目
通过不同网站的报文请求的分析及js断点调试,结合scrapy框架和selenium的特点对今日头条、哔哩哔哩、抖音、快手、东方财富等站点的数据爬取、处理及上传。
爬取数据内容形式主要有视频、图片以及文章段落。
数据的处理依据需求分别设置了针对段落文字的过滤词过滤及长度过滤;针对图片的水印过滤裁切;针对视频长度的过滤;
过程中遇到过麻烦的问题有滑块验证、cookie关键加密串验证等,滑块验证曾用添加特殊cookie的方式解决,针对抖音的滑块验证采用cv2识别解决;cookie关键加密串通过js断点调试找到加密方法,特别麻烦的有如抖音的s_v_web_id通过使用selenium模拟解决