项目需求:爬取多个公开网站的图片、视频、文本信息、招标信息等数据。
涉及技术:
1.观察网页结构,寻找网站接口,解析接口数据结构,获取指定数据。
2.通过 js 逆向解决参数加密与网站数据加密等问题。
3.通过使用动态代理 IP 和随机 User-Agent 等方法解决反爬问题。
4.通过 Selenium 来模拟浏览器操作以解决动态加载网页的问题。
5.使用多线程解决数据爬取速度问题。
数据处理:
使用正则表达式对爬取的数据进清洗,利用 pandas 将数据进行结构化、去重整理,统一入库或存储为 csv 文件。
开发数据批处理、邮件自动化发送、数据拆分、汇总等脚本文件