项目描述 该项目是指运用科学的方法和手段,根据用就业市场调查所提供的数据和资料和对各种就业网站爬取的数据,来对机器学习模型进行训练,使该模型具有预测分类的功能,然后用该模型来对用户就业提供咨询。 个人职责: 1、采用Scrapy 框架、Scrapy-redis、Requests、Aiohttp、Selenium 等库,采集各地区婚恋网站,将数据存在hdfs 集群中。 2、搭建Hadoop 集群环境搭建,用hdfs 系统存储海量数据的用户信息。 3、运用matplotlib 可视化工具,对数据进行探索分析、查看特征关系。 4、通过pandas 等工具对采集数据进行清洗。 5、基于对
对珍爱网,世纪佳缘,人人网,百合网,地方婚恋网等婚恋社交类网站进行个人信息采集,爬虫是基于Scrapy-Redis 技术实现,数据基于hdfs 集群进行存储,采集数据达到5000 万。 个人职责: 1.根据网站指定不同的爬取规则及解析方式。 2.数据去重问题。解决方案:Scrapy-Redis 调度器调度策略设置去重策略 3.使用自己封装的 IP 代理池,并定期维护代理池。实现代理IP 的爬取与可用性检测 4.js逆向,请求加密,响应加密,用过关键字或方法或拦截器进行定位,找到对应的请求响应加密代码,对代码扣取代码或者webpack或有瑞数对其进行处理,补依赖,补环境,做真假值验证,
项目描述 该项目是指运用科学的方法和手段,根据用就业市场调查所提供的数据和资料和对各种就业网站爬取的数据,来对机器学习模型进行训练,使该模型具有预测分类的功能,然后用该模型来对用户就业提供咨询。 个人职责: 1、采用Scrapy 框架、Scrapy-redis、Requests、Aiohttp、Selenium 等库,采集各地区婚恋网站,将数据存在hdfs 集群中。 2、搭建Hadoop 集群环境搭建,用hdfs 系统存储海量数据的用户信息。 3、运用matplotlib 可视化工具,对数据进行探索分析、查看特征关系。 4、通过pandas 等工具对采集数据进行清洗。 5、基于对...
对珍爱网,世纪佳缘,人人网,百合网,地方婚恋网等婚恋社交类网站进行个人信息采集,爬虫是基于Scrapy-Redis 技术实现,数据基于hdfs 集群进行存储,采集数据达到5000 万。 个人职责: 1.根据网站指定不同的爬取规则及解析方式。 2.数据去重问题。解决方案:Scrapy-Redis 调度器调度策略设置去重策略 3.使用自己封装的 IP 代理池,并定期维护代理池。实现代理IP 的爬取与可用性检测 4.js逆向,请求加密,响应加密,用过关键字或方法或拦截器进行定位,找到对应的请求响应加密代码,对代码扣取代码或者webpack或有瑞数对其进行处理,补依赖,补环境,做真假值验证,...
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人