Ezio🦈

大数据高级开发
远景动力 · 5年经验
Ezio🦈
日薪: ¥800/8h
地点: 苏州
时间: 下班后周六周日可工作日远程
ID:431010 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | Django Flask 微服务 Spring Boot Spring Java Python RESTful 分布式 Kafka Redis Hadoop Spark Flink Hive
1. 精通大数据生态全栈开发。
熟悉Hadoop生态(HDFS、YARN、Hive)及实时/离线计算引擎(Spark、Flink),熟练掌握Doris/ClickHouse等OLAP引擎的建模与性能调优,具备PB级数据湖(Iceberg/Hudi)架构经验。熟悉dbt进行数据转换与测试,具备完整的数据仓库/数据湖从0到1建设能力,涵盖ETL/ELT流程设计、数据治理与任务调度(Airflow/DolphinScheduler)。

2. 后端开发

具备扎实的后端开发能力。熟练使用Java(Spring Boot/Cloud)及Python(Django/Flask)进行企业级应用开发,擅长RESTful API设计与微服务架构落地。能够独立完成从需求分析、数据库设计到接口开发的全流程工作,代码规范,注重可维护性与性能。

3. 中间件与容器化
熟悉常用中间件及容器化技术。熟练使用Redis进行缓存设计与分布式锁实现,具备Kafka消息队列在数据管道/日志采集场景下的实战经验。熟练掌握Docker容器化部署与编排,熟悉MinIO/S3对象存储的部署与应用开发,具备基础的Kubernetes运维能力。

4. AI辅助开发与Agent搭建
具备AI原生应用开发能力。熟悉Dify等LLM应用开发平台,能够基于RAG技术搭建企业知识库问答系统。掌握MCP协议,具备AI Agent/Skill开发经验,擅长将大语言模型能力与业务场景结合(如NL2SQL、智能问数、自动化流程等),实现AI驱动的效率提升。

5. 阿里云云原生开发
具备阿里云全栈云原生开发经验。熟练使用OSS对象存储、MaxCompute/DataWorks大数据开发平台、ACK容器服务、SLS日志服务等核心云产品,熟悉基于阿里云生态的数据上云、存储计算与业务系统部署,能够设计高可用、弹性伸缩的云上架构

1. PB级企业数据湖搭建
负责主导PB级企业数据湖架构设计与落地实施。面对日均TB级数据增量及多样化数据源(业务库、日志、物联网流数据),采用Lambda架构结合Hudi/Iceberg等开源数据湖格式,实现存储与计算分离。通过设计统一元数据管理与分区策略,将查询性能提升40%,数据入湖延迟从小时级降低至分钟级。同时建立数据生命周期管理机制与冷热分层存储方案,有效控制存储成本约30%。该数据湖支撑了全司20+个业务线及数百名数据工程师/分析师的日常作业,为上层BI报表、即席分析和AI模型训练提供了稳定、可靠的数据底座。

2. AI问数Agent及语义层建设
负责面向企业级数据分析场景的AI问数Agent与统一语义层系统建设。针对业务用户取数难、SQL门槛高的痛点,设计并实现了基于NL2SQL技术的智能问答引擎。核心工作包括:构建统一的业务语义层(Metric/Logic View),将复杂的数据模型抽象为业务友好的指标与维度体系;基于大语言模型(LLM)与检索增强生成(RAG)技术,实现自然语言到SQL的高效准确转换;设计多轮对话与意图澄清机制,提升复杂查询场景下的用户体验。系统上线后,业务人员自助取数需求响应时间从天级缩短至秒级,50%以上的常规报表需求可由Agent自动完成,显著释放了数据团队的人力。

3. 工业产线图片采集上云系统搭建
负责工业产线图片采集与云端上传系统的全流程架构与开发。面对产线高频(每秒数十张)、大文件(单张数十MB)的图片流,设计并实现了边缘端采集-压缩-缓存-断点续传的可靠链路。采用轻量级边缘网关进行图片预处理与格式转换,通过消息队列(Kafka/RabbitMQ)解耦采集与上传流程,确保产线PLC(可编程逻辑控制器)侧不受网络抖动影响。上传层基于OSS/S3对象存储,结合CDN加速与生命周期管理,实现了海量图片数据的云端归档与快速检索。系统上线后,支持了上百条产线、每天数百万张图片的稳定上云,为后续AI质检模型训练提供了高质量、持续更新的数据源。
Ezio🦈 ID:431010 复制

Ezio🦈

大数据高级开发 · 5年经验 · 远景动力
城市苏州 日薪800元/8h 时间 下班后周六周日可工作日远程
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | Django Flask 微服务 Spring Boot Spring Java Python RESTful 分布式 Kafka Redis Hadoop Spark Flink Hive
1. 精通大数据生态全栈开发。
熟悉Hadoop生态(HDFS、YARN、Hive)及实时/离线计算引擎(Spark、Flink),熟练掌握Doris/ClickHouse等OLAP引擎的建模与性能调优,具备PB级数据湖(Iceberg/Hudi)架构经验。熟悉dbt进行数据转换与测试,具备完整的数据仓库/数据湖从0到1建设能力,涵盖ETL/ELT流程设计、数据治理与任务调度(Airflow/DolphinScheduler)。

2. 后端开发

具备扎实的后端开发能力。熟练使用Java(Spring Boot/Cloud)及Python(Django/Flask)进行企业级应用开发,擅长RESTful API设计与微服务架构落地。能够独立完成从需求分析、数据库设计到接口开发的全流程工作,代码规范,注重可维护性与性能。

3. 中间件与容器化
熟悉常用中间件及容器化技术。熟练使用Redis进行缓存设计与分布式锁实现,具备Kafka消息队列在数据管道/日志采集场景下的实战经验。熟练掌握Docker容器化部署与编排,熟悉MinIO/S3对象存储的部署与应用开发,具备基础的Kubernetes运维能力。

4. AI辅助开发与Agent搭建
具备AI原生应用开发能力。熟悉Dify等LLM应用开发平台,能够基于RAG技术搭建企业知识库问答系统。掌握MCP协议,具备AI Agent/Skill开发经验,擅长将大语言模型能力与业务场景结合(如NL2SQL、智能问数、自动化流程等),实现AI驱动的效率提升。

5. 阿里云云原生开发
具备阿里云全栈云原生开发经验。熟练使用OSS对象存储、MaxCompute/DataWorks大数据开发平台、ACK容器服务、SLS日志服务等核心云产品,熟悉基于阿里云生态的数据上云、存储计算与业务系统部署,能够设计高可用、弹性伸缩的云上架构

项目经验

1. PB级企业数据湖搭建
负责主导PB级企业数据湖架构设计与落地实施。面对日均TB级数据增量及多样化数据源(业务库、日志、物联网流数据),采用Lambda架构结合Hudi/Iceberg等开源数据湖格式,实现存储与计算分离。通过设计统一元数据管理与分区策略,将查询性能提升40%,数据入湖延迟从小时级降低至分钟级。同时建立数据生命周期管理机制与冷热分层存储方案,有效控制存储成本约30%。该数据湖支撑了全司20+个业务线及数百名数据工程师/分析师的日常作业,为上层BI报表、即席分析和AI模型训练提供了稳定、可靠的数据底座。

2. AI问数Agent及语义层建设
负责面向企业级数据分析场景的AI问数Agent与统一语义层系统建设。针对业务用户取数难、SQL门槛高的痛点,设计并实现了基于NL2SQL技术的智能问答引擎。核心工作包括:构建统一的业务语义层(Metric/Logic View),将复杂的数据模型抽象为业务友好的指标与维度体系;基于大语言模型(LLM)与检索增强生成(RAG)技术,实现自然语言到SQL的高效准确转换;设计多轮对话与意图澄清机制,提升复杂查询场景下的用户体验。系统上线后,业务人员自助取数需求响应时间从天级缩短至秒级,50%以上的常规报表需求可由Agent自动完成,显著释放了数据团队的人力。

3. 工业产线图片采集上云系统搭建
负责工业产线图片采集与云端上传系统的全流程架构与开发。面对产线高频(每秒数十张)、大文件(单张数十MB)的图片流,设计并实现了边缘端采集-压缩-缓存-断点续传的可靠链路。采用轻量级边缘网关进行图片预处理与格式转换,通过消息队列(Kafka/RabbitMQ)解耦采集与上传流程,确保产线PLC(可编程逻辑控制器)侧不受网络抖动影响。上传层基于OSS/S3对象存储,结合CDN加速与生命周期管理,实现了海量图片数据的云端归档与快速检索。系统上线后,支持了上百条产线、每天数百万张图片的稳定上云,为后续AI质检模型训练提供了高质量、持续更新的数据源。
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏