1. PB级企业数据湖搭建
负责主导PB级企业数据湖架构设计与落地实施。面对日均TB级数据增量及多样化数据源(业务库、日志、物联网流数据),采用Lambda架构结合Hudi/Iceberg等开源数据湖格式,实现存储与计算分离。通过设计统一元数据管理与分区策略,将查询性能提升40%,数据入湖延迟从小时级降低至分钟级。同时建立数据生命周期管理机制与冷热分层存储方案,有效控制存储成本约30%。该数据湖支撑了全司20+个业务线及数百名数据工程师/分析师的日常作业,为上层BI报表、即席分析和AI模型训练提供了稳定、可靠的数据底座。
2. AI问数Agent及语义层建设
负责面向企业级数据分析场景的AI问数Agent与统一语义层系统建设。针对业务用户取数难、SQL门槛高的痛点,设计并实现了基于NL2SQL技术的智能问答引擎。核心工作包括:构建统一的业务语义层(Metric/Logic View),将复杂的数据模型抽象为业务友好的指标与维度体系;基于大语言模型(LLM)与检索增强生成(RAG)技术,实现自然语言到SQL的高效准确转换;设计多轮对话与意图澄清机制,提升复杂查询场景下的用户体验。系统上线后,业务人员自助取数需求响应时间从天级缩短至秒级,50%以上的常规报表需求可由Agent自动完成,显著释放了数据团队的人力。
3. 工业产线图片采集上云系统搭建
负责工业产线图片采集与云端上传系统的全流程架构与开发。面对产线高频(每秒数十张)、大文件(单张数十MB)的图片流,设计并实现了边缘端采集-压缩-缓存-断点续传的可靠链路。采用轻量级边缘网关进行图片预处理与格式转换,通过消息队列(Kafka/RabbitMQ)解耦采集与上传流程,确保产线PLC(可编程逻辑控制器)侧不受网络抖动影响。上传层基于OSS/S3对象存储,结合CDN加速与生命周期管理,实现了海量图片数据的云端归档与快速检索。系统上线后,支持了上百条产线、每天数百万张图片的稳定上云,为后续AI质检模型训练提供了高质量、持续更新的数据源。