项目:新闻资讯爬虫与舆情监测系统
项目描述:开发新闻资讯爬虫,实时抓取各大新闻网站的新闻内容,构建舆情监测系统,为公司公关部门提供舆情预警与分析服务。
工作职责:
运用 Scrapy - Redis 分布式爬虫框架,实现多台服务器协同工作,将新闻数据采集效率提升了10倍。
针对新闻网站的验证码反爬虫机制,采用机器学习方法,利用 TensorFlow 训练验证码识别模型,识别准确率达到70%,有效突破验证码限制。同时,结合打码平台备用,确保在复杂验证码场景下爬虫仍能稳定运行。
对采集到的新闻文本进行自然语言处理,使用 Jieba 分词工具进行分词,结合 TextBlob 进行情感分析,判断新闻的情感倾向(正面、负面、中性),为舆情监测提供量化指标。
将处理后的数据存储到 MongoDB 数据库,利用其灵活的文档存储结构适应新闻数据的多样性。搭建基于 Flask 的 Web 应用,为公关部门提供友好的舆情监测界面,方便其实时查看新闻动态与舆情分析结果。