一、招聘网站爬虫(智联、拉钩、前程无忧,百姓网)
项目简介:
该爬虫运用scrapy框架,在招聘网站进行登录,然后搜索工作,抽取网页信息(职位详情及联系人信息),可实现筛选简历,并自动进行简历投递
二、淘宝商品信息抓取
项目要求:输入关键字,通过淘宝网获取商品信息
1、使用ip代理
2、最终可实现定向精准搜索,搜索结果可按人气、销量、价格等排列
3、通过销量排序,选择销量第一的商品获取用户评论(异步加载)
4、对用户评价进行词云分析
三、东方购物商品信息抓取(约50万)
项目简介:
爬取网站:东方购物
责任描述:使用scrapy框架,负责爬虫脚本的编写,主要解析网站数据结构,设计防爬策略,网页信息抽取,数据存储入库
目标:通过抓取首页各大分类下的商品链接,获取所有详细商品信息