。。

爬虫工程师
川成 · 2年经验
。。
日薪: ¥500/8h
地点: 其他 全区
时间: 下班后周六周日
ID:258490 复制

0
接单数
0
评价数
1
收藏数

AI 技能提取 | Selenium 高并发 Python HTML 分布式 Node.js MySQL Redis MongoDB Docker Ajax
Python 后端基础:熟练使用 requests / aiohttp 实现高并发请求,掌握 BeautifulSoup、lxml、正则、XPath 进行 HTML/XML 解析;熟悉 pandas 数据清洗与去重,支持 Excel/CSV/JSON 等多种导出格式。

动态网页与反爬对抗:精通 Selenium、Playwright 模拟真实浏览器行为,能够处理无限滚动、iframe、异步加载;具备抓包分析能力(Fiddler / Chrome DevTools),能识别 Ajax 接口并直接调用 JSON API,绕开页面渲染开销。

JS逆向工程:能够定位前端加密参数(如 sign、token、__zp_stoken__),通过堆栈调试扣取加密算法,使用 PyExecJS、Node.js 或补环境方式还原加密逻辑。

反爬策略应对:熟练配置代理 IP 池(住宅代理 / 隧道代理)、随机 User-Agent、请求延时与重试机制;能够识别并绕过简单的验证码(OCR、第三方打码平台),针对 Rate Limit 实现自适应降速。

数据存储与管理:熟悉 MySQL、MongoDB、Redis,支持增量采集与断点续爬,能够设计数据表结构并完成 ETL 入库。

框架与工程化:使用 Scrapy 框架构建分布式爬虫,集成 Splash 渲染;掌握 Docker 部署、日志监控、定时任务(cron / Airflow)。

此外,我熟悉国内外电商、社交媒体、招聘网站的数据采集边界,严格遵循 robots.txt 并规避法律风险,确保客户数据合规可用。累计完成 50+ 商业爬虫项目,涵盖价格监控、舆情分析、房源采集等场景,交付代码稳定、文档清晰、维护及时。

京东商品价格与评论实时监控系统
背景:某电商代运营公司需要监控50个竞品SKU的每日价格、促销标签及用户评论情感倾向,用于动态调整定价策略。

技术栈:Python、Playwright、Redis、MySQL、代理IP池

核心难点:

京东商品页价格通过 JS 动态渲染,且请求参数包含 sign 加密签名;

频繁访问会触发风控(滑块验证、IP 封禁);

评论数据分页接口带有 _t 时间戳和 callback 参数。

解决方案:

使用 Playwright 监听网络请求,直接捕获价格接口的 JSON 响应,避免解析 HTML;

逆向分析签名生成逻辑,定位到 genSign() 函数,用 Python 重写加密算法;

自动轮换 IP,并设置随机间隔 3~8 秒;

评论采集采用协程异步 + Redis 去重,日处理 10 万+ 条评论。

成果:系统稳定运行 6 个月,帮助客户发现竞品调价窗口期,单月增收 20%。交付完整代码及运行文档,客户给予好评并续签维护合同。
。。 ID:258490 复制

。。

爬虫工程师 · 2年经验 · 川成
城市其他 全区 日薪500元/8h 时间 下班后周六周日
0
累计接单
0
用户评价
1
被收藏

信用行为

0
接单数
0
评价数
1
收藏数

技术能力

AI 技能提取 | Selenium 高并发 Python HTML 分布式 Node.js MySQL Redis MongoDB Docker Ajax
Python 后端基础:熟练使用 requests / aiohttp 实现高并发请求,掌握 BeautifulSoup、lxml、正则、XPath 进行 HTML/XML 解析;熟悉 pandas 数据清洗与去重,支持 Excel/CSV/JSON 等多种导出格式。

动态网页与反爬对抗:精通 Selenium、Playwright 模拟真实浏览器行为,能够处理无限滚动、iframe、异步加载;具备抓包分析能力(Fiddler / Chrome DevTools),能识别 Ajax 接口并直接调用 JSON API,绕开页面渲染开销。

JS逆向工程:能够定位前端加密参数(如 sign、token、__zp_stoken__),通过堆栈调试扣取加密算法,使用 PyExecJS、Node.js 或补环境方式还原加密逻辑。

反爬策略应对:熟练配置代理 IP 池(住宅代理 / 隧道代理)、随机 User-Agent、请求延时与重试机制;能够识别并绕过简单的验证码(OCR、第三方打码平台),针对 Rate Limit 实现自适应降速。

数据存储与管理:熟悉 MySQL、MongoDB、Redis,支持增量采集与断点续爬,能够设计数据表结构并完成 ETL 入库。

框架与工程化:使用 Scrapy 框架构建分布式爬虫,集成 Splash 渲染;掌握 Docker 部署、日志监控、定时任务(cron / Airflow)。

此外,我熟悉国内外电商、社交媒体、招聘网站的数据采集边界,严格遵循 robots.txt 并规避法律风险,确保客户数据合规可用。累计完成 50+ 商业爬虫项目,涵盖价格监控、舆情分析、房源采集等场景,交付代码稳定、文档清晰、维护及时。

项目经验

京东商品价格与评论实时监控系统
背景:某电商代运营公司需要监控50个竞品SKU的每日价格、促销标签及用户评论情感倾向,用于动态调整定价策略。

技术栈:Python、Playwright、Redis、MySQL、代理IP池

核心难点:

京东商品页价格通过 JS 动态渲染,且请求参数包含 sign 加密签名;

频繁访问会触发风控(滑块验证、IP 封禁);

评论数据分页接口带有 _t 时间戳和 callback 参数。

解决方案:

使用 Playwright 监听网络请求,直接捕获价格接口的 JSON 响应,避免解析 HTML;

逆向分析签名生成逻辑,定位到 genSign() 函数,用 Python 重写加密算法;

自动轮换 IP,并设置随机间隔 3~8 秒;

评论采集采用协程异步 + Redis 去重,日处理 10 万+ 条评论。

成果:系统稳定运行 6 个月,帮助客户发现竞品调价窗口期,单月增收 20%。交付完整代码及运行文档,客户给予好评并续签维护合同。
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏