图书网站爬取

工具 云盘|下载 案例ID:193624
昵称
6 年经验· 山西长河科技有限公司
微信扫码沟通,客服可协助直接对接工程师;如当前档期不合,也可继续推荐相似案例作者。

案例介绍

项目描述:爬取各个大型图书网站,如新华书店图书网,在线网上图书一号店等。获取它们图书的名称,简介,购买量,评
论量,评论数据,价格等,存入数据库。
项目技能:requests,Xpath,json,Redis,MongoDB ,协程,re
项目职责:
1.使用 requests 模块,发送 http 请求,使用协程进行爬取网页,提高爬虫效率
2.分析需要爬取的数据,发现在 ajax 请求中,数据格式为 json 。使用 re 模块在返回的 response.content 中匹配需求数据,获取
到数据
3.自定义 get_ua 函数,,调用 get_ua 随机获取 user-agent ,对 request 对象来进行包装,应对反爬

图书网站爬取

工具 · 云盘|下载 案例ID:193624
联系该工程师
微信扫码,建群沟通
作者: 昵称 - 6年经验- 山西长河科技有限公司

案例介绍

项目描述:爬取各个大型图书网站,如新华书店图书网,在线网上图书一号店等。获取它们图书的名称,简介,购买量,评
论量,评论数据,价格等,存入数据库。
项目技能:requests,Xpath,json,Redis,MongoDB ,协程,re
项目职责:
1.使用 requests 模块,发送 http 请求,使用协程进行爬取网页,提高爬虫效率
2.分析需要爬取的数据,发现在 ajax 请求中,数据格式为 json 。使用 re 模块在返回的 response.content 中匹配需求数据,获取
到数据
3.自定义 get_ua 函数,,调用 get_ua 随机获取 user-agent ,对 request 对象来进行包装,应对反爬

相似案例推荐

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在 1 小时内与您联系确认。

1小时精推人才

需求方专属客服,免费梳理匹配

需求方客服微信二维码
扫码加微信 · 客服人工对接
更多案例
微信沟通 客服 看中这位工程师了?客服帮你 1 小时对接沟通 → ×