项目描述:该项目旨在爬取多个新闻资讯网站的数据,并进行数据清洗、分析和可视化展示。我负责爬虫开发和数据处理部分。
责任描述:
爬虫开发:使用 Scrapy 框架编写爬虫程序,爬取了多个知名新闻网站的新闻标题、内容、发布时间等信息。针对不同网站的反爬机制,采用了设置代理 IP、随机 User-Agent、处理验证码等策略,确保了爬虫的稳定运行。
数据处理:使用 Pandas 库对爬取到的数据进行清洗和预处理,去除了重复数据、缺失值和异常值。对新闻内容进行了分词、词频统计等文本分析操作,提取了热门关键词。
数据可视化:使用 Power BI 将处理后的数据进行可视化展示,制作了新闻热点趋势图、关键词云图等报表,为业务决策提供了数据支持。