91再生(包括PC端与移动端)
负责网站web开发,编写相关相虫程序,想出反反爬策略,数据清洗,分表存储。
1、需要爬虫的数据经过分拆,得出是所需要的数据可进过POST请求并携带参数得到,考虑到数据最较多,采用scrapy-redis进行起取,因为该框架实现url和数据去重、持久化,分布式比较方便,构建RedisSpider分布式爬虫,爬取更快
2、下我的微信二维码图片有些因为格式原因无法打开,筛选出来,通过os模块对这些图片批量重多名加后缀
3、每个代理人的个人网站详情页面模板不太一栏,但是有三种页面的HTML结构,在提取资格证号的时娱,需要谝写三仲页面的xpath提取代码,进行三次判断,对应每种页面的HTML特征,适用对应的提取方法
4、考虑网站能否打开和打开时间问题,一般能要加异常判断。超时,retry等成少报措
5、数据按公司分表存储于mysgl,减经一个表的负数
6、批建USER-AGENT池,使电随机代理,随机iP采用阿布云动态ip