1. 大模型驱动光伏幕墙 BIM 自动生成系统
面向光伏幕墙项目前期方案展示、报价测算和深化设计场景,负责搭建基于大模型的项目生成 Agent,实现根据项目需求自动生成特定建筑的光伏 BIM 模型。构建城市信息 RAG 系统补充项目所在地相关信息,降低大模型幻觉;使用 SFT、GRPO 对 Qwen2.5-32B 进行微调,提升模型对建筑立面及幕墙划分任务的理解能力。同时集成多个 BIM 生成模块,设计统一文件管理和模块间数据传输流程,引入 Three.js 完成 BIM 模型前端展示,并通过 Docker 完成系统部署。
2. 公安场景多模态视频理解大模型
面向公安指定业务场景的视频智能分析需求,负责多模态视频理解模型的场景适配和应用开发。根据实际业务设计 Prompt 并制作多场景视频数据集,通过 LoRA 对多模态大模型进行微调,增强模型对特定人物、车辆及事件场景的理解能力。基于 Streamlit + AutoGen 搭建视频上传、分析和自然语言问答系统,同时优化多段视频中的指定车辆追踪及 ReID 问题,最终在国产 GPU 服务器上使用 Docker 完成模型部署。
3. 边缘端 AI 模型部署与性能优化
负责大模型及深度学习模型在多种边缘计算设备上的部署和性能优化,重点解决模型“服务器能跑、端侧跑不动”的问题。针对 RDK S100 等开发板,对 Florence-2 等视觉模型进行算子替换、模型量化和推理流程优化,在尽可能保持精度的情况下提升端侧运行效率。同时独立完成 RK3588 + 4G 模块软硬件系统开发,实现远程网络反向代理、短信收发和语音电话转接,具备较完整的边缘设备软硬件集成能力。
4. 音频伪造与对抗检测系统
针对麦克风输入音频的真实性检测需求,独立在多款开发板上开展音频伪造和对抗检测算法研发。结合 DSP 信号处理算法与深度学习模型,完成音频数据处理、特征分析、模型推理以及端侧部署流程,重点解决边缘设备算力受限情况下的实时音频检测问题。项目在实际测试中取得了相关置信度 82.6% 的检测结果,积累了音频 AI、模型优化及嵌入式部署经验。