ID:426545

1

爬虫工程师

  • 公司信息:
  • 光谱云人工智能有限公司(北京)
  • 工作经验:
  • 2年
  • 兼职日薪:
  • 500元/8小时
  • 兼职时间:
  • 下班后
  • 所在区域:
  • 北京
  • 海淀

技术能力

1. 基础爬虫技术
熟练掌握Python爬虫核心基础库,精通Requests、Urllib发送HTTP/HTTPS请求,熟练处理GET、POST、PUT等各类请求方式,可自主完成请求头伪装、参数拼接、表单提交、Cookie携带等基础操作,精准模拟浏览器正常访问行为。精通HTML、CSS、JavaScript前端基础语法,能够快速分析网页源码结构,精准定位数据节点。
熟练运用XPath、BeautifulSoup、PyQuery三大网页解析工具,实现网页文本、图片、链接、表格、隐藏字段等各类结构化、半结构化数据的精准提取与清洗,可高效剔除无效数据、重复数据,保证爬取数据的准确性与完整性。
2. 动态网页与反爬应对技术
针对静态、动态渲染网页具备完善的爬取能力,熟练使用Selenium、Playwright模拟真实浏览器操作,解决JS动态渲染、Ajax异步加载数据爬取难题,支持页面滚动、点击、输入、下拉选择、弹窗关闭等自动化交互操作。掌握Scrapy异步爬虫框架,理解框架中间件、管道、爬虫文件运行机制,可快速搭建高效分布式、多线程爬虫项目。
具备丰富的反爬虫规避实战经验,熟练处理常见反爬机制:可通过请求头伪装、User-Agent随机切换、Referer、Origin参数伪造模拟真人访问;掌握Cookie、Session会话保持技术,维持登录态爬取权限数据;熟练运用代理IP池解决IP封禁问题;掌握验证码识别基础方案,可通过打码平台、简单滑块、图文验证码识别突破基础验证机制;精通接口加密参数逆向分析,可抓包解析JS加密逻辑,破解签名、token、时间戳等加密参数,实现接口数据直接爬取。
3. 数据存储与异步优化技术
熟练适配多种数据存储方式,可将爬取数据持久化存储至本地文件与数据库:支持Excel、CSV、TXT、JSON等本地文件批量写入与导出;熟练操作MySQL、MongoDB数据库,掌握数据增删改查、批量插入、去重、索引优化等操作,适配结构化与非结构化数据存储场景。
掌握爬虫性能优化技术,熟练运用多线程、多进程、协程(aiohttp)实现异步并发爬取,大幅提升爬虫采集效率;掌握爬虫限速、重试、异常捕获机制,解决网络超时、请求失败、页面加载异常等问题,提升爬虫稳定性;具备数据去重、增量爬取能力,通过指纹校验、时间戳比对实现增量更新,避免重复采集。

项目经验

项目一:通用电商商品数据爬虫(静态+动态混合爬取)
项目简介:针对主流电商平台商品数据进行批量采集,解决电商网页动态加载、IP限制、数据分页加载等问题,实现商品名称、价格、销量、店铺信息、评价、商品参数等全维度数据的自动化采集,为市场数据分析、竞品调研提供数据支撑。
技术栈:Python、Requests、XPath、Playwright、MySQL、代理IP池、多线程、正则表达式
核心实现:
- 通过抓包分析商品列表接口与详情页异步请求,对静态页面采用Requests直接请求+XPath解析,对JS动态渲染的详情页面使用Playwright模拟浏览器加载,完整获取异步展示的商品数据;
- 优化反爬策略,配置随机User-Agent、请求间隔限速,接入代理IP池规避IP封禁,通过Session保持会话,实现登录态下的权限数据爬取;
- 采用多线程并发爬取机制,大幅提升分页数据采集效率,同时添加异常捕获、超时重试机制,避免网络波动导致程序中断;
- 对爬取数据进行清洗去重,利用正则表达式过滤特殊符号、统一价格格式,最终将标准化数据批量存入MySQL数据库,支持数据查询、导出与统计。
项目成果:单小时可稳定采集3000+条商品数据,爬虫稳定性强、误码率低,实现全自动增量爬取,为电商竞品分析项目提供了完整、精准的数据源。

信用行为

  • 接单
    0
  • 评价
    0
  • 收藏
    0
微信扫码,建群沟通

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在1小时内与您联系,1小时内精准确定人才

微信接收人才推送

关注猿急送微信平台,接收实时人才推送

接收人才推送
联系需求方端客服
联系需求方端客服