拥有10年人工智能算法研发经验,精通计算机视觉、多模态大模型及边缘端AI部署全链路技术。
**深度学习与计算机视觉:** 熟练掌握YOLOv5~YOLOv11系列目标检测算法、DETR检测框架、RetinaFace/ArcFace/CosFace人脸检测与识别算法、PaddleOCR文字识别、OpenPose姿态估计、AdvancedEast场景文字检测等主流算法。具备从模型设计、训练调优到工程化落地的完整能力,能根据业务场景对网络结构进行改进优化,如改进EAST长文本边界提取、在YOLO检测头层融入雷达特征增强小目标检测等。
**多模态大模型:** 熟练使用QwenVL系列、CLIP/OpenCLIP等多模态大模型,掌握LoRA微调技术,能够针对家庭场景宠物行为分析、视频行为合规分析等业务场景进行模型微调适配。具备大模型图文匹配、视频文字匹配算法研发经验。
**边缘端芯片部署:** 深入掌握多种国产及国际边缘芯片的算法移植部署,包括华为昇腾、寒武纪、算能、瑞芯微(RK1106等)、Sigmastar、富瀚、地平线、NVIDIA Jetson/Xavier等平台。能够完成从模型转换、SDK源码修改、量化校准到C++推理模块编写、后处理代码开发的全流程工作,具备硬解码YUV420直接NPU推理推流的极致性能优化能力。
**模型优化与压缩:** 熟练掌握模型量化、知识蒸馏(CML、DML)等模型压缩技术,能够在保证精度的前提下大幅降低模型体积和推理延迟,适配资源受限的嵌入式设备。
**工程与框架:** 熟练使用PyTorch、libtorch、ONNX、TensorRT等深度学习框架和推理引擎,掌握ROS通信框架下AI算法实时推理架构搭建。具备C++后端算法适配能力。同时拥有Hadoop、Hive、Spark、Flume等大数据框架使用经验,以及SVM、GBDT、逻辑回归等传统机器学习算法实践经验。
**项目一:家庭智慧IPC相机行为识别系统(2025.11-至今)**
负责家庭场景下宠物行为分析的算法研发与嵌入式部署。使用OpenCLIP进行LoRA微调实现家庭场景宠物行为识别,针对Sigmastar 2386芯片修改CLIP图像编码器SDK源码,解决常量取值范围及量化算法对激活值极值转化容忍度问题。同时完成YOLOv11在Sigmastar 2386、瑞芯微1106、富瀚8856v500三款芯片上的适配部署,实现模型蒸馏压缩以满足嵌入式设备的算力与内存约束。
**项目二:机场安全监测多模态分析系统(2024.08-2025.09)**
作为算法负责人,负责昇腾芯片上算法模型的完整移植部署。实现硬解码YUV420图像直接NPU推理、推理结果画框、硬编码推流的全流程,全程无需转RGB,达到极致性能。通过改进YOLO网络结构提升极小目标识别效果,利用QwenVL2.5加LoRA微调进行视频行为合规分析,采用ByteTracker结合传统图像处理二次帧差方式实现多目标跟踪。
**项目三:高速交通雷视融合检测系统(2023.03-2024.08)**
作为算法组负责人,负责基于ROS架构的算法模块通信开发。完成NVIDIA、昇腾、瑞芯微、寒武纪、比特大陆五款芯片上车辆检测、车牌识别、天气分类、抛洒物检测等算法的模型移植,并将各芯片推理代码集成至ROS架构统一部署。核心创新点在于将雷达点云数据处理为图像特征,在检测网络head层融入雷达特征,构建融合特征目标检测算法,有效增强小目标及弱光环境下的检测效果。
**项目四:智慧油站AI2.0项目(2021.05-2023.02)**
作为项目负责人,基于PyTorch、libtorch、ONNX技术栈,使用YOLOv5、CenterNet算法实现加油站卸油区八步法分析、工服检测、车流统计、车牌识别等功能。负责C++后端算法适配与精度调整,完成地平线芯片算法盒子移植优化及Xavier平台部署,通过模型量化和CML/DML蒸馏压缩保证推理速度与精度。
**项目五:人脸检索与OCR识别系统(2019.03-2021.04)**
作为架构师,复现并训练RetinaFace人脸检测模型,解决开源算法中动物脸误检问题。使用亚洲人脸数据集重新复现ArcFace、CosFace人脸识别模型训练,转化为ONNX模型并生成TensorRT引擎加速推理。在OCR方面,改进EAST算法的loss函数,解决长文本文字边界提取不准确问题,实现税票、发票、广告文本的高精度检测识别。
本项目为高速公路场景下的智能交通检测系统,核心解决传统纯视觉方案在小目标检测、弱光/逆光环境下检测效果差的痛点。 技术方案:将毫米波雷达的点云数据处理为图像特征数据,在YOLO目标检测网络的Head层融入雷达特征,构建了融合特征的目标检测算法。相比纯视觉方案,该算法在小目标
本项目为机场安全场景下的多模态智能监测系统,涵盖极小目标检测、视频行为合规分析、多目标跟踪三大核心能力。 极致性能优化:在昇腾芯片上实现硬解码YUV420图像直接进行NPU推理,推理结果直接在YUV图像上画框,再通过硬编码推流输出,全程无需转换为RGB格式,大幅降低内存开销
本项目为家庭场景下IPC智能相机的宠物行为识别系统,将多模态大模型能力下沉到资源受限的嵌入式设备,实现家庭场景中宠物行为的智能分析。 多模态大模型微调:使用OpenCLIP模型进行LoRA低秩适配微调,针对家庭场景中的宠物奔跑、睡觉、进食等行为进行识别。仅微调少量参数即可适
本项目为加油站AI2.0智慧管理系统,通过计算机视觉技术实现加油站作业全流程的智能化监控与管理,涵盖卸油作业规范检测、员工工服识别、车流统计、车牌识别四大核心功能。 卸油区八步法分析:基于YOLOv5目标检测与CenterNet关键点检测,结合时序状态机判断,实时监测卸油作
本项目包含人脸检索系统和发票税票OCR识别两大模块,服务于金融报税系统中的身份验证和票据数字化场景。 人脸检索系统:复现并训练RetinaFace人脸检测模型,针对开源算法中动物脸误检问题进行改进优化,使动物脸误检率降至0.5%以下。使用亚洲人脸数据集重新复现ArcFace