I want to try.คิดถึง

python爬虫
珠海格力电器股份有限公司。 · 1年经验
I want to try.คิดถึง
日薪: ¥500/8h
地点: 北京 海淀
时间: 下班后周六周日
ID:334386 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | Redis MongoDB Selenium HTML HTTP
请求发送与响应处理:使用Requests库进行HTTP请求的发送和响应的处理,是网络爬虫的重要工具。同时,支持设置请求头、Cookies、代理等

页面解析:利用BeautifulSoup库来解析HTML代码,提取所需的数据。此外,XPath和正则表达式也是常用的页面解析方法

数据存储:数据抓取后需要存储起来,常用的数据库有MongoDB、Redis等。

反爬虫应对策略:随着网站的安全性提高,越来越多的网站采取了反爬虫措施。因此,学习如何规避这些反爬虫机制变得尤为重要

动态网页处理:对于动态生成的网页,可以使用Selenium模拟浏览器行为进行数据抓取。

爬虫框架:除了基础的Requests和BeautifulSoup外,还有多种成熟的爬虫框架可供选择,如Scrapy、PySpider等。这些框架提供了丰富的功能和灵活的扩展性,使得爬取网页数据变得简单高效。

高级技巧:包括多线程

中铁股份相关项目

2022-10-23 ~ 2023-1-1

中国中铁股份有限公司

爬虫开发工程师

在授信流程中,用户授权提供各大电商平台的账号信息,爬虫通过

代码模拟登陆用户账号,爬取账号下的信息包括:用户基本信息、

银行卡信息、历史订单信息、物流信息、商品信息、团购信息、积

分信息等,保存 MongoDB,然后根据具体需求进行数据清洗保

存 MySQL,提供给风控后台进行风险管控,最终完成授信提供用

户相应的消费额度。

构建爬虫框架:编写爬虫基类,实现获取代理、爬取、数据保存入

库、异常处理、重爬等逻辑,不同平台继承基类实现统一调度

搭建 Django 爬虫管理平台:对各个电商网站数据爬取情况分站点展示,按照 session 对每个爬虫请求进行管理,提供测试功能通过

页面展示的登陆表单填写账号密码等信息点击登陆触发爬虫进行测试;提供查询功能查看每个 session 的爬取请求和最终爬取数据;

提供重爬功能支持页面点击手动重爬;提供统计功能可以按照日期和各种爬取状态为维度统计爬取数量和爬取成功率。

搭建 Django 验证码识别平台:对于需要验证码识别的网站,收集样本并进行标注,通过深度学习 CNN 等算法进行模型训练,然后

将训练好的模型放到 Django 项目中,提供接口给爬虫平台调用

华夏幸福基业相关项目

华夏幸福基业股份有限公司

2022-2-1 ~ 2023-8-8

爬虫开发工程师

根据公司的业务需求,对网络上各个平台的金融数据,股票信息,进行爬取,为公司提供大量有效数据,进行数据分析,技术支持。

使用技术:Python,NumPy,Pandas, threading,gevent,requests

技术要点:

使用 Python 第三方库 requests 爬取页面。

模拟各种浏览器去拿到页面信息 html。

启用多线程,协程并发抓取网页信息,提高爬取的效率
I want to try.คิดถึง ID:334386 复制

I want to try.คิดถึง

python爬虫 · 1年经验 · 珠海格力电器股份有限公司。
城市北京 海淀 日薪500元/8h 时间 下班后周六周日
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | Redis MongoDB Selenium HTML HTTP
请求发送与响应处理:使用Requests库进行HTTP请求的发送和响应的处理,是网络爬虫的重要工具。同时,支持设置请求头、Cookies、代理等

页面解析:利用BeautifulSoup库来解析HTML代码,提取所需的数据。此外,XPath和正则表达式也是常用的页面解析方法

数据存储:数据抓取后需要存储起来,常用的数据库有MongoDB、Redis等。

反爬虫应对策略:随着网站的安全性提高,越来越多的网站采取了反爬虫措施。因此,学习如何规避这些反爬虫机制变得尤为重要

动态网页处理:对于动态生成的网页,可以使用Selenium模拟浏览器行为进行数据抓取。

爬虫框架:除了基础的Requests和BeautifulSoup外,还有多种成熟的爬虫框架可供选择,如Scrapy、PySpider等。这些框架提供了丰富的功能和灵活的扩展性,使得爬取网页数据变得简单高效。

高级技巧:包括多线程

项目经验

中铁股份相关项目

2022-10-23 ~ 2023-1-1

中国中铁股份有限公司

爬虫开发工程师

在授信流程中,用户授权提供各大电商平台的账号信息,爬虫通过

代码模拟登陆用户账号,爬取账号下的信息包括:用户基本信息、

银行卡信息、历史订单信息、物流信息、商品信息、团购信息、积

分信息等,保存 MongoDB,然后根据具体需求进行数据清洗保

存 MySQL,提供给风控后台进行风险管控,最终完成授信提供用

户相应的消费额度。

构建爬虫框架:编写爬虫基类,实现获取代理、爬取、数据保存入

库、异常处理、重爬等逻辑,不同平台继承基类实现统一调度

搭建 Django 爬虫管理平台:对各个电商网站数据爬取情况分站点展示,按照 session 对每个爬虫请求进行管理,提供测试功能通过

页面展示的登陆表单填写账号密码等信息点击登陆触发爬虫进行测试;提供查询功能查看每个 session 的爬取请求和最终爬取数据;

提供重爬功能支持页面点击手动重爬;提供统计功能可以按照日期和各种爬取状态为维度统计爬取数量和爬取成功率。

搭建 Django 验证码识别平台:对于需要验证码识别的网站,收集样本并进行标注,通过深度学习 CNN 等算法进行模型训练,然后

将训练好的模型放到 Django 项目中,提供接口给爬虫平台调用

华夏幸福基业相关项目

华夏幸福基业股份有限公司

2022-2-1 ~ 2023-8-8

爬虫开发工程师

根据公司的业务需求,对网络上各个平台的金融数据,股票信息,进行爬取,为公司提供大量有效数据,进行数据分析,技术支持。

使用技术:Python,NumPy,Pandas, threading,gevent,requests

技术要点:

使用 Python 第三方库 requests 爬取页面。

模拟各种浏览器去拿到页面信息 html。

启用多线程,协程并发抓取网页信息,提高爬取的效率
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏