目的:针对客户端电子书应用存在正版收费的情况,对于新发布的小说文学作品在免费的情况下进行阅读 技术:python,requests,lxml,os, mysql 实现:通过获取到资源对应的网站链接,对网页结构进行分析,提取出需要的字段内容 难点:数据采集时因为采集频率过高触发网站断开响应,使用random+sleep随机1-3s休眠,爬取一段时间后网站仍会断开链接; 针对多次访问网页断开链接的情况,使用mysql数据库存储已经采集国的页面链接和总体的页面链接,网站断开服务后第二 次重新爬取判断爬取的网页链接是否在存储的页面链接中,成功解决。
目的:通过获取票房数据集进行分析当前票房一段时间内的电影票房增长的趋势 技术:python, selenium, requests, mysql, pymysql 内容:通过分析猫眼网页结构,发现数据以json格式存储,使用requests请求存放数据的页面链接获取数据,并解析和分析有关电影在某时间段内的总销售状况 难点:使用selenium元素选择器获取到的网页上的字段信息列表,对于元素列表遍历后对当前元素对象操作,发现下一次遍历时第二个元素对象将无法使用
目的:针对客户端电子书应用存在正版收费的情况,对于新发布的小说文学作品在免费的情况下进行阅读 技术:python,requests,lxml,os, mysql 实现:通过获取到资源对应的网站链接,对网页结构进行分析,提取出需要的字段内容 难点:数据采集时因为采集频率过高触发网站断开响应,使用random+sleep随机1-3s休眠,爬取一段时间后网站仍会断开链接; 针对多次访问网页断开链接的情况,使用mysql数据库存储已经采集国的页面链接和总体的页面链接,网站断开服务后第二 次重新爬取判断爬取的网页链接是否在存储的页面链接中,成功解决。...
目的:通过获取票房数据集进行分析当前票房一段时间内的电影票房增长的趋势 技术:python, selenium, requests, mysql, pymysql 内容:通过分析猫眼网页结构,发现数据以json格式存储,使用requests请求存放数据的页面链接获取数据,并解析和分析有关电影在某时间段内的总销售状况 难点:使用selenium元素选择器获取到的网页上的字段信息列表,对于元素列表遍历后对当前元素对象操作,发现下一次遍历时第二个元素对象将无法使用...
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人