ID:427348

🍥🍥

网络爬虫工程师

  • 公司信息:
  • 工科在校211研究生
  • 工作经验:
  • 1年
  • 兼职日薪:
  • 500元/8小时
  • 兼职时间:
  • 下班后
  • 周六
  • 周日
  • 可工作日远程
  • 可工作日驻场(自由职业原因)
  • 所在区域:
  • 广州
  • 番禺

技术能力

精通 Python 开发,核心擅长网络数据爬虫项目开发。熟练运用 Requests、Playwright、BeautifulSoup、XPath 等技术,实现静态网页与动态渲染网站的数据采集;掌握异步、多线程爬虫开发,优化采集速度。可针对性解决各类网站反爬限制,支持代理池配置、访问频率控制。能够完成原始数据清洗、去重,将结构化数据存入 MySQL、MongoDB 数据库。具备代码调试、异常捕获能力,保障爬虫长期稳定运行。了解爬虫相关合规规范,可按照业务需求设计轻量化、可拓展的数据采集方案,配套完成数据预处理,支撑后续数据分析工作。

项目经验

主导多个 Python 爬虫数据采集项目,熟练处理静态页面与 JS 动态渲染网站的数据获取。使用 Requests、Playwright、BeautifulSoup 构建采集程序,运用异步协程、多线程方案提升采集效率;通过代理池、访问间隔控制、请求头伪装等手段应对各类反爬策略。完成采集数据清洗、去重、格式标准化,将数据持久化至 MySQL、MongoDB 数据库;增加异常捕获、运行日志模块,提升程序鲁棒性。可根据需求定制周期性采集任务,兼顾采集效率与网站访问规范,输出高质量结构化数据集,支撑业务数据分析工作。

案例展示

  • 采集某公司查询网站指定城市中指定公司信息

    采集某公司查询网站指定城市中指定公司信息

    目标网站:天眼查 目标网址:https://www.tianyancha.com/ 任务需求:分别搜索北京半导体、上海半导体、深圳半导体、广州半导体、杭州半导体、成都半导体 这6个关键字,并使用多任务的方式分别获取40个公司的数据。 采集字段:参考下图中红色方框里的信息,若

  • 采集某药物临床平台数据信息

    采集某药物临床平台数据信息

    目标网站:药物临床实验登记 目标网址:https://www.chinadrugtrials.org.cn/clinicaltrials.searchlist.dhtml 任务需求:使用selenium,采集前100页的数据信息。 采集字段:登记号、试验状态、药物名称、适应

查看案例列表(含更多 0 个案例)

相似人才推荐

信用行为

  • 接单
    0
  • 评价
    0
  • 收藏
    0
微信扫码,建群沟通

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在1小时内与您联系,1小时内精准确定人才

微信接收人才推送

关注猿急送微信平台,接收实时人才推送

接收人才推送
联系需求方端客服
联系需求方端客服