业务层面:站点视频数据抓取(包括但不限于优酷、爱奇艺、cntv、b站等视频站点) ,各站点文章数据抓取(包含各类国内国外站点) 公司主要做媒体网站数据聚合服务,涉及到的业务主要是抓取各类媒体网站文章信息,并做数据清理和结构化处理。
主要涉及技术点包括架构层面:公司自建爬虫架构,包含老系统改造,建立架构层面的scrapy,scrapy-redis
反爬层面:IP防封,访问频次处理,模拟验证码操作,登录cookie处理,数据js 加密。
项目职责:运用 Python爬虫系统自建 分布式爬虫 flask接口开发,反selenium+phantomjs模拟抓取(豆瓣搜索接口破解) 抓取方式:网页抓取,APP抓取,全站深度优先抓取,广度优先抓取(优酷网全网视频数据深度抓取) 系统层面:爬虫运行状态监控,日志处理系统,爬虫抓取性能持续优化。
抓取方式:网页抓取,APP抓取。
项目业绩:完成了全站深度优先抓取,广度优先抓取 系统层面的爬虫运行状态监控,日志处理系统,爬虫任务调度系统,爬虫抓取性能持续优化。