华为云 IaaS 及高阶服务:算力规划、架构设计、部署实施;
有GPU集群或HPC环境实战经验;
有千卡规模GPU集群运维经验,支撑过大模型训练或线上推理业务;
深入理解Linux内核、网络与存储栈,能定位底层性能瓶颈;
精通Slurm调度(训练)与Kubernetes生产集群(推理),能独立完成架构设计与调优;
熟悉RDMA网络(IB/RoCE),能协助排查NCCL集合通信相关问题;
熟练Python/Shell,有自动化运维平台或工具建设经验;
熟悉Prometheus/Grafana监控体系,有大规模集群监控与告警建设经验;
建设自动化运维工具与监控告警体系,持续提升集群稳定性与排障效率;
主流数据库运维、故障定位排查;