舆情监测项目
根据客户指定的行业方向/监测关键字,通过对微博、主流门户网站、微信公众号、视频网站等主流互联网媒体进行大规模的爬虫数据采集,得到舆情监测报告基础数据,并进行数据清洗,以及简要的维度统计。
责任描述:
1、负责爬虫整体项目环境的搭建,采用Scrapy-redis框架进行分布式爬虫,并使用布隆过滤器实现高效的爬虫队列。
2、负责微博爬虫开发,使用Selenium模拟微博登陆,获取Cookie并搭建Cookie,并对接代理池,有效减少微博反爬封号。
3、负责门户网站爬虫开发,实现简单的调度模块对接Scrapy,进行每日自动爬虫。
4、负责视频网站app端爬虫开发,通过手机端CA证书截取网络通信数据,实现信息爬取