ID:407691

玄枢 有团队

数据采集工程师

  • 公司信息:
  • 达实智能
  • 工作经验:
  • 5年
  • 兼职日薪:
  • 500元/8小时
  • 兼职时间:
  • 周六
  • 周日
  • 所在区域:
  • 深圳
  • 南山

技术能力

拥有多年数据采集与数据分析实战经验,精通 Python 爬虫开发与大规模数据清洗处理全流程。技术栈覆盖 Scrapy、Requests、Playwright、Selenium 等主流框架与工具,能够针对不同网站结构灵活制定采集策略。在反爬对抗方面,熟练掌握 Cookie 池管理、动态代理 IP 轮换、浏览器指纹模拟及常见 JS 加密参数逆向解析,可稳定突破各类反爬机制。数据处理环节熟练运用 Pandas、NumPy 进行高效清洗与结构化转换,结合 MySQL、MongoDB、Redis 完成海量数据的存储与调度管理。曾主导多个电商价格监控、社交媒体舆情分析及行业竞品数据聚合项目,从需求拆解、爬虫架构设计、自动化调度到最终数据可视化报表输出,具备端到端的完整交付能力。熟悉 Linux 服务器部署与定时任务运维,注重代码规范与采集合规性。善于将零散异构的原始数据转化为可供业务决策参考的结构化资产,持续关注数据质量与采集效率的平衡优化。

项目经验

1. 多平台公开数据采集与舆情分析系统
针对内容社区与短视频平台(小红书、抖音)开展公开数据采集专项,通过解析小红书帖子分享链接提取笔记标题、正文、点赞收藏数、评论等元数据;针对抖音采用 App 抓包与 Web 端结合的方式,逆向签名算法获取视频列表、评论区数据,覆盖热榜监控、评论情感分析等场景。项目累计采集数十万条内容数据,构建热点话题追踪与 KOL 评估模型。

2. 主流电商平台商品与价格监控系统
面向淘宝、京东等电商站点搭建分布式采集集群,应对登录态校验、滑块验证、请求频率限制等反爬机制,通过动态 User-Agent 池、高质量代理 IP 轮换、请求节奏随机化等手段保障采集稳定性。系统每日增量抓取千万级 SKU 的商品标题、价格、销量、评价等字段,支撑竞品定价策略分析与市场趋势洞察。

3. 数据清洗与结构化存储管道
所有采集数据经由 ETL 流程进行去重、异常值剔除、字段标准化,统一写入 MySQL 与 MongoDB,并通过 Redis 缓存热点数据。结合 Pandas 做后续统计分析,输出可视化报表,为业务方提供决策依据。

团队情况

  • 整包服务: 其他开发   
角色 职位
负责人 数据采集工程师
队员 后端工程师

案例展示

  • 抖音视频评论数据采集

    抖音视频评论数据采集

    针对抖音平台视频评论区数据,开发了一套完整的评论采集与解析功能。系统支持通过视频分享链接或视频 ID定位目标作品,调用评论列表接口实现分页拉取,稳定获取一级评论及二级回复评论。每条评论可结构化提取评论发布者昵称、评论者抖音号、IP 属地(ip_label)、评论文本内容、评论时间

  • 小红书帖子信息采集

    小红书帖子信息采集

    小红书笔记帖子信息采集模块 针对小红书平台内容生态,开发了一套基于帖子分享链接的笔记信息采集功能。系统支持输入单篇或多篇笔记的分享 URL,自动解析短链重定向获取笔记唯一 ID(note_id),进而通过 Web 端接口或浏览器渲染方式拉取笔记详情页全量数据。 在字段

查看案例列表(含更多 0 个案例)

信用行为

  • 接单
    0
  • 评价
    0
  • 收藏
    0
微信扫码,建群沟通

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在1小时内与您联系,1小时内精准确定人才

微信接收人才推送

关注猿急送微信平台,接收实时人才推送

接收人才推送
联系需求方端客服
联系需求方端客服