同时兼具运维、AI 开发、大模型训练复合技术能力,精通 Linux 全栈服务器运维与 PVE 虚拟化集群搭建,可独立完成多算力节点部署、虚拟机资源调度、网络权限隔离、磁盘扩容与故障排错;熟练运用 Docker 容器化方案,实现 Ollama、OpenWebUI 本地化大模型推理环境封装,配置环境变量、持久化存储与服务自动化启停脚本。
精通大模型完整训练链路,熟练操作 Deepseek-r1、MiniCPM-V 等多模态大模型,掌握数据集清洗标注、LoRA 轻量化微调、q4_K_M 量化压缩、显存资源调优等核心流程,可针对垂直行业完成模型定制优化;熟练使用 GPUinfo、CPU-Z、TestMem5、FurMark 等工具完成显卡、内存硬件稳定性校验,排查硬件底层篡改、显存溢出、训练中断等问题。
具备 AI 业务系统开发落地能力,基于 JeecgBoot、Nocobase 低代码平台完成业务数据表设计、流程搭建,打通本地大模型推理接口实现智能分析功能;擅长自动化运维脚本编写、服务器 7×24 小时监控、共享文件精细化权限管控,可兼顾算力集群运维、大模型迭代训练、AI 业务应用开发全流程工作。
负责公司大模型训练集群日常运维保障,处理显存溢出、训练任务中断、数据集加载异常等各类故障;搭建标准化数据集清洗、标注、版本管理流程,隔离训练、测试、生产多套环境;建立硬件自动化检测机制,批量校验服务器 GPU、内存硬件稳定性,规避硬件缺陷导致训练任务损毁;支撑研发团队持续开展垂直领域大模型迭代,大幅降低集群故障频次,缩短模型训练排障时长,提升研发迭代效率。
本项目为垂直行业私有化 AI 算力底座建设方案,我全权负责集群运维、容器部署与硬件资源调度。基于 Proxmox VE 搭建多节点虚拟化集群,完成高性能 GPU 服务器组网、虚拟机网络隔离与存储扩容;采用 Docker 封装 Ollama+OpenWebUI 推理服务,配置环境变
本项目面向专业业务场景开发本地化 AI 智能研判系统,我承担大模型训练、AI 接口对接、低代码业务平台搭建全流程工作。完成多模态大模型数据集清洗标注、LoRA 轻量化微调与量化压缩,适配行业影像、文本解析需求;基于低代码平台设计业务数据表、审批流程,打通本地大模型推理接口,实现业
本项目面向专业业务场景开发本地化 AI 智能研判系统,我承担大模型训练、AI 接口对接、低代码业务平台搭建全流程工作。完成多模态大模型数据集清洗标注、LoRA 轻量化微调与量化压缩,适配行业影像、文本解析需求;基于低代码平台设计业务数据表、审批流程,打通本地大模型推理接口,实现业