oywryr

数据采集实习生
深圳新能智慧充电科技有限公司 · 1年经验
oywryr
日薪: ¥500/8h
地点: 深圳
时间: 周六周日可工作日远程可工作日驻场(自由职业原因)
ID:416985 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | Python Flask MySQL Kafka Hadoop Spark Flink HBase Hive ZooKeeper Android yarn
大数据工程技术本科在读,求职 Python / 数据开发 / 数据采集方向,期望深圳。熟悉 Python、Flask、MySQL,具备全栈开发能力;掌握 Scrapy、BeautifulSoup、requests、uiautomator2、OCR 等采集技术;熟悉 Hadoop 全生态,包括 HDFS、MapReduce、YARN、Hive、HBase、ZooKeeper、Sqoop、Flume、Kafka,了解 Spark/Flink。能独立完成从数据采集、传输、存储、离线分析到可视化展示的完整链路。

项目方面,独立完成校园二手交易平台“校园拍”,基于 Flask + MySQL 实现注册登录、验证码、商品发布、图片上传、远程 SFTP、日志、JSON 缓存、数据库连接池等模块,负责前后端联调与数据库设计。独立完成 EV 充电易采集项目,基于香港环保署公开接口采集约 970 个充电站,按充电器类型输出静态 CSV 1273 行、实时 CSV 442 行,支持并发请求、失败重试、超时控制、定时循环和 8—10 分钟随机间隔,并提供交接文档。参与南山充电站数据采集项目,基于 Python + uiautomator2 实现 Android App 自动化,覆盖高德、百度、特来电、滴滴充电、星星充电、云快充、新电途等平台,采集桩位状态、功率、空闲数、分时价格等数据,开发随机平台调度器,通过模拟人类浏览、点击、等待降低自动化特征,结合 OCR、截图裁剪兜底解析。

EV 充电易 | 数据采集开发

负责香港环保署 EV 充电易网站数据采集,基于 Python requests 对接公开接口,采集约 970 个充电站数据。按充电器类型拆分输出静态 CSV 和实时 CSV:静态表 1273 行,实时表 442 行,仅保留有实时传感器数据的充电类型。实现 access_token 获取、站点列表、配置字典、区域字典、地区字典和站点详情并发请求,并发数 8,单次请求超时 30 秒,失败重试 3 次。设计静态表按 7 天覆盖更新、实时表每次新增一份的存储策略,支持 RUN_FOREVER 定时循环,每轮间隔 8—10 分钟随机等待,避免固定频率请求。使用 utf-8-sig 输出 CSV,保证 Excel 直接打开不乱码。支持 .env 配置输出目录、并发数、超时、重试、更新周期、循环间隔等参数,并提供完整交接文档,便于后续维护和二次运行。项目验证结果:站点总数 970,静态 1273 行,实时 442 行,实时 CSV 空可用数量 0 行,可用数量为 0 会有效保留。

南山充电站数据采集项目 | 开发

负责深圳市南山区充电站数据采集系统开发,基于 Python + uiautomator2 控制 Android 真机/模拟器,实现多平台 App 自动化采集。覆盖高德、百度、特来电、滴滴充电、星星充电、云快充、新电途等平台,采集站点名称、地址、桩位状态、功率、空闲数、分时价格、电费、服务费等数据。针对页面不可直接读取的情况,使用 OCR、截图裁剪和文本解析兜底。开发统一数据读写层 common/station_data_io.py,按 crawl_time 追加历史观测,避免覆盖远端已有记录。开发随机平台调度器 random_platform_crawl.py,依据 crawl_scope.json 筛选南山区街道,每批随机选择平台和 3—4 个站点,支持 --plan-only、--serial、--reset-state 等参数。通过 模拟人类采集方法/ 模块在 App 内随机浏览、点击、等待,降低自动化特征。支持 --limit、--name、--dry-run、--target-file 等参数,便于小批量验证、设备指定、失败复采和历史结果反查。项目输出 charging_stations/ 下基础状态与价格 JSON,保证数据可追溯、可维护。

校园拍 | 全栈工程师

基于 Flask + MySQL 开发校园二手交易平台,支持用户注册登录、验证码、商品发布、商品详情、个人中心、消息通知等功能。负责前后端联调、数据库设计与接口开发,使用 DBUtils 连接池和 PyMySQL 操作 MySQL;实现图片 Base64 上传、SSH/SFTP 远程存储、日志记录、商品 JSON 缓存、验证码生成等模块。采用蓝图模块化设计,提升系统可维护性,支持校园内二手商品发布与流转。通过该项目,掌握了 Flask 应用工厂、蓝图、连接池、远程文件上传、日志分级和缓存读写等后端开发核心技能。

猎聘平台采集与可视化大屏项目 | 开发

负责猎聘平台招聘数据采集与可视化展示,完成从数据采集、清洗、传输、存储到可视化大屏的完整链路。使用 Python 采集招聘数据,通过 Flume、Kafka 进行数据传输和消息队列处理,使用 Hive 进行数据存储和离线分析,最终以可视化大屏展示岗位分布、薪资区间、学历要求、地区热度等指标。通过该项目,熟悉了 Hadoop 生态组件在实际数据链路中的配合方式,具备大数据采集、传输、存储、分析和可视化落地的实践经验。

Hadoop 全生态技能实践

熟悉 HDFS 分布式存储、MapReduce 离线计算、YARN 资源调度、Hive 数据仓库、HBase 列式存储、ZooKeeper 协调服务、Sqoop 数据迁移、Flume 日志采集、Kafka 消息队列;了解 Spark/Flink 计算框架。能够完成数据从采集到入仓、从分析到展示的基本流程搭建,具备大数据平台组件协同使用能力。
oywryr ID:416985 复制

oywryr

数据采集实习生 · 1年经验 · 深圳新能智慧充电科技有限公司
城市深圳 日薪500元/8h 时间 周六周日可工作日远程可工作日驻场(自由职业原因)
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | Python Flask MySQL Kafka Hadoop Spark Flink HBase Hive ZooKeeper Android yarn
大数据工程技术本科在读,求职 Python / 数据开发 / 数据采集方向,期望深圳。熟悉 Python、Flask、MySQL,具备全栈开发能力;掌握 Scrapy、BeautifulSoup、requests、uiautomator2、OCR 等采集技术;熟悉 Hadoop 全生态,包括 HDFS、MapReduce、YARN、Hive、HBase、ZooKeeper、Sqoop、Flume、Kafka,了解 Spark/Flink。能独立完成从数据采集、传输、存储、离线分析到可视化展示的完整链路。

项目方面,独立完成校园二手交易平台“校园拍”,基于 Flask + MySQL 实现注册登录、验证码、商品发布、图片上传、远程 SFTP、日志、JSON 缓存、数据库连接池等模块,负责前后端联调与数据库设计。独立完成 EV 充电易采集项目,基于香港环保署公开接口采集约 970 个充电站,按充电器类型输出静态 CSV 1273 行、实时 CSV 442 行,支持并发请求、失败重试、超时控制、定时循环和 8—10 分钟随机间隔,并提供交接文档。参与南山充电站数据采集项目,基于 Python + uiautomator2 实现 Android App 自动化,覆盖高德、百度、特来电、滴滴充电、星星充电、云快充、新电途等平台,采集桩位状态、功率、空闲数、分时价格等数据,开发随机平台调度器,通过模拟人类浏览、点击、等待降低自动化特征,结合 OCR、截图裁剪兜底解析。

项目经验

EV 充电易 | 数据采集开发

负责香港环保署 EV 充电易网站数据采集,基于 Python requests 对接公开接口,采集约 970 个充电站数据。按充电器类型拆分输出静态 CSV 和实时 CSV:静态表 1273 行,实时表 442 行,仅保留有实时传感器数据的充电类型。实现 access_token 获取、站点列表、配置字典、区域字典、地区字典和站点详情并发请求,并发数 8,单次请求超时 30 秒,失败重试 3 次。设计静态表按 7 天覆盖更新、实时表每次新增一份的存储策略,支持 RUN_FOREVER 定时循环,每轮间隔 8—10 分钟随机等待,避免固定频率请求。使用 utf-8-sig 输出 CSV,保证 Excel 直接打开不乱码。支持 .env 配置输出目录、并发数、超时、重试、更新周期、循环间隔等参数,并提供完整交接文档,便于后续维护和二次运行。项目验证结果:站点总数 970,静态 1273 行,实时 442 行,实时 CSV 空可用数量 0 行,可用数量为 0 会有效保留。

南山充电站数据采集项目 | 开发

负责深圳市南山区充电站数据采集系统开发,基于 Python + uiautomator2 控制 Android 真机/模拟器,实现多平台 App 自动化采集。覆盖高德、百度、特来电、滴滴充电、星星充电、云快充、新电途等平台,采集站点名称、地址、桩位状态、功率、空闲数、分时价格、电费、服务费等数据。针对页面不可直接读取的情况,使用 OCR、截图裁剪和文本解析兜底。开发统一数据读写层 common/station_data_io.py,按 crawl_time 追加历史观测,避免覆盖远端已有记录。开发随机平台调度器 random_platform_crawl.py,依据 crawl_scope.json 筛选南山区街道,每批随机选择平台和 3—4 个站点,支持 --plan-only、--serial、--reset-state 等参数。通过 模拟人类采集方法/ 模块在 App 内随机浏览、点击、等待,降低自动化特征。支持 --limit、--name、--dry-run、--target-file 等参数,便于小批量验证、设备指定、失败复采和历史结果反查。项目输出 charging_stations/ 下基础状态与价格 JSON,保证数据可追溯、可维护。

校园拍 | 全栈工程师

基于 Flask + MySQL 开发校园二手交易平台,支持用户注册登录、验证码、商品发布、商品详情、个人中心、消息通知等功能。负责前后端联调、数据库设计与接口开发,使用 DBUtils 连接池和 PyMySQL 操作 MySQL;实现图片 Base64 上传、SSH/SFTP 远程存储、日志记录、商品 JSON 缓存、验证码生成等模块。采用蓝图模块化设计,提升系统可维护性,支持校园内二手商品发布与流转。通过该项目,掌握了 Flask 应用工厂、蓝图、连接池、远程文件上传、日志分级和缓存读写等后端开发核心技能。

猎聘平台采集与可视化大屏项目 | 开发

负责猎聘平台招聘数据采集与可视化展示,完成从数据采集、清洗、传输、存储到可视化大屏的完整链路。使用 Python 采集招聘数据,通过 Flume、Kafka 进行数据传输和消息队列处理,使用 Hive 进行数据存储和离线分析,最终以可视化大屏展示岗位分布、薪资区间、学历要求、地区热度等指标。通过该项目,熟悉了 Hadoop 生态组件在实际数据链路中的配合方式,具备大数据采集、传输、存储、分析和可视化落地的实践经验。

Hadoop 全生态技能实践

熟悉 HDFS 分布式存储、MapReduce 离线计算、YARN 资源调度、Hive 数据仓库、HBase 列式存储、ZooKeeper 协调服务、Sqoop 数据迁移、Flume 日志采集、Kafka 消息队列;了解 Spark/Flink 计算框架。能够完成数据从采集到入仓、从分析到展示的基本流程搭建,具备大数据平台组件协同使用能力。
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏