薄荷撞可乐

python爬虫开发工程师
北京票加科技有限公司 · 2年经验
薄荷撞可乐
日薪: ¥500/8h
地点: 石家庄 全区
时间: 下班后周六周日
ID:419410 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | 高并发 分布式 Redis Selenium Node.js Elasticsearch JavaScript MySQL MongoDB 小程序 Python
本人专注于Python网络爬虫与数据采集领域,具备从需求分析、反爬对抗到数据清洗交付的全栈式闭环能力。核心掌握技术如下:
底层请求与框架: 熟练使用Requests、aiohttp进行高效请求,精通Scrapy框架及分布式爬虫(Scrapy-Redis)的开发与部署,具备高并发数据抓取经验。
动态渲染与自动化: 深度掌握Selenium、Playwright及DrissionPage的使用,精通浏览器指纹伪装、DOM动态渲染页面的抓取,能有效绕过Cloudflare五秒盾等基础风控。
JS逆向与加密对抗: 具备较强的JavaScript逆向分析能力,熟练使用Chrome DevTools进行断点调试,能独立扣取及还原常见的加密算法(MD5、AES、RSA等),掌握JS混淆代码的还原与Node.js补环境技术。
验证码与反爬突破: 熟悉各类验证码(极验滑块、点选、图文等)的破解思路,能对接第三方打码平台实现自动化过码;熟练运用代理IP池策略解决IP封禁问题。
APP与小程序抓取: 掌握Charles、Fiddler、mitmproxy等抓包工具,能处理HTTPS抓包及部分APP的SSL Pining绕过。
数据处理与入库: 熟练使用Pandas、正则表达式进行复杂的数据清洗与结构化处理,支持MySQL、MongoDB、Elasticsearch及CSV/Excel等多种格式的稳定入库与导出。

项目一:某大型电商平台全站商品数据采集与监控系统
项目描述: 针对客户竞品分析需求,开发针对某头部电商平台的分布式爬虫系统,需采集千万级商品信息(标题、价格、SKU、评价等),并实现每日价格波动监控。
技术难点与方案:目标网站反爬极严,存在动态Cookie生成、请求参数加密及滑块验证码。通过JS逆向分析破解了其核心Sign签名算法,使用Playwright结合自建指纹库处理动态加载与过码,引入高匿住宅代理IP池轮换机制,最终实现日均稳定采集百万级数据,封控率控制在1%以下。

项目二:某社交媒体平台公开舆情数据定向提取
项目描述:为某营销公司定制开发针对特定话题、达人的公开笔记与评论抓取工具,要求按关键词检索并下载无水印图片及视频资源。
技术难点与方案:目标站点接口存在复杂的动态X-S签名校验及环境检测。通过深度逆向其前端JS逻辑,使用Node.js搭建本地加密服务,Python端通过RPC调用获取实时签名,完美绕过前端风控。针对无水印资源,通过解析页面渲染数据包提取原始OSS链接进行下载,交付高效稳定的单机版自动化工具。

项目三:全国企业工商公开信息聚合采集
项目描述:针对B2B销售获客需求,从多个公开企业信息平台定向抓取指定行业的公司名称、联系方式、经营范围等公开数据。
技术难点与方案:目标站点存在字体反爬(动态字体映射)和CSS偏移反爬。通过建立字体文件解析映射表,结合OCR模型识别解决动态字体解密问题;使用lxml与XPath精准提取偏移文本,最终输出去重、清洗后的高质量Excel数据表,帮助客户快速建立销售线索库。
薄荷撞可乐 ID:419410 复制

薄荷撞可乐

python爬虫开发工程师 · 2年经验 · 北京票加科技有限公司
城市石家庄 全区 日薪500元/8h 时间 下班后周六周日
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | 高并发 分布式 Redis Selenium Node.js Elasticsearch JavaScript MySQL MongoDB 小程序 Python
本人专注于Python网络爬虫与数据采集领域,具备从需求分析、反爬对抗到数据清洗交付的全栈式闭环能力。核心掌握技术如下:
底层请求与框架: 熟练使用Requests、aiohttp进行高效请求,精通Scrapy框架及分布式爬虫(Scrapy-Redis)的开发与部署,具备高并发数据抓取经验。
动态渲染与自动化: 深度掌握Selenium、Playwright及DrissionPage的使用,精通浏览器指纹伪装、DOM动态渲染页面的抓取,能有效绕过Cloudflare五秒盾等基础风控。
JS逆向与加密对抗: 具备较强的JavaScript逆向分析能力,熟练使用Chrome DevTools进行断点调试,能独立扣取及还原常见的加密算法(MD5、AES、RSA等),掌握JS混淆代码的还原与Node.js补环境技术。
验证码与反爬突破: 熟悉各类验证码(极验滑块、点选、图文等)的破解思路,能对接第三方打码平台实现自动化过码;熟练运用代理IP池策略解决IP封禁问题。
APP与小程序抓取: 掌握Charles、Fiddler、mitmproxy等抓包工具,能处理HTTPS抓包及部分APP的SSL Pining绕过。
数据处理与入库: 熟练使用Pandas、正则表达式进行复杂的数据清洗与结构化处理,支持MySQL、MongoDB、Elasticsearch及CSV/Excel等多种格式的稳定入库与导出。

项目经验

项目一:某大型电商平台全站商品数据采集与监控系统
项目描述: 针对客户竞品分析需求,开发针对某头部电商平台的分布式爬虫系统,需采集千万级商品信息(标题、价格、SKU、评价等),并实现每日价格波动监控。
技术难点与方案:目标网站反爬极严,存在动态Cookie生成、请求参数加密及滑块验证码。通过JS逆向分析破解了其核心Sign签名算法,使用Playwright结合自建指纹库处理动态加载与过码,引入高匿住宅代理IP池轮换机制,最终实现日均稳定采集百万级数据,封控率控制在1%以下。

项目二:某社交媒体平台公开舆情数据定向提取
项目描述:为某营销公司定制开发针对特定话题、达人的公开笔记与评论抓取工具,要求按关键词检索并下载无水印图片及视频资源。
技术难点与方案:目标站点接口存在复杂的动态X-S签名校验及环境检测。通过深度逆向其前端JS逻辑,使用Node.js搭建本地加密服务,Python端通过RPC调用获取实时签名,完美绕过前端风控。针对无水印资源,通过解析页面渲染数据包提取原始OSS链接进行下载,交付高效稳定的单机版自动化工具。

项目三:全国企业工商公开信息聚合采集
项目描述:针对B2B销售获客需求,从多个公开企业信息平台定向抓取指定行业的公司名称、联系方式、经营范围等公开数据。
技术难点与方案:目标站点存在字体反爬(动态字体映射)和CSS偏移反爬。通过建立字体文件解析映射表,结合OCR模型识别解决动态字体解密问题;使用lxml与XPath精准提取偏移文本,最终输出去重、清洗后的高质量Excel数据表,帮助客户快速建立销售线索库。
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

暂不接受预约

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏 暂不接受 微信沟通 立即沟通