熟练掌握主流 Linux 操作系统日常运维,精通系统初始化、服务部署、故障排查、动态链接库冲突、磁盘与网络调优;熟练使用 Shell 脚本实现自动化运维,能够编写批量部署、日志分析、健康巡检脚本。
精通 Docker 容器、Docker Swarm 集群部署与维护,熟悉微服务基础运维;掌握 MySQL 基础运维,包含实例启停、基础 SQL 优化、日常备份恢复。
熟练搭建云原生监控体系,能够部署 Prometheus、Alertmanager、OpenTelemetry Collector、Tempo 组件,完成指标采集、链路追踪、告警规则配置;熟悉 Nacos 服务注册中心运维,处理服务注册异常、连接超时等问题。
具备服务器硬件调试、BMC 远程管理、RAID 配置、系统镜像安装实操经验;擅长处理程序依赖库冲突、进程崩溃、端口占用、网络连通性等线上故障;熟悉主机监控 Agent 批量部署方案,能够完成大规模服务器运维标准化落地,具备良好的线上应急排障能力。
1、服务器标准化运维改造项目:负责多台 Linux 服务器环境治理,解决 curl 库版本冲突、环境变量错乱等兼容性问题,统一系统 PATH 优先级,规范依赖库管理;完成主机监控 Agent 批量一键部署,实现服务器指标统一采集监控,降低单机故障排查耗时。
2、云原生监控平台搭建项目:独立部署 Prometheus、Tempo、告警中心整套监控组件,完成业务应用链路追踪接入,配置分级告警策略,完善服务可观测能力,快速定位接口超时、服务调用异常问题。
3、容器集群运维保障项目:维护 Docker Swarm 业务集群,处理容器启动异常、网络互通、资源限制问题,优化容器健康检查配置;配合开发团队排查 Nacos 微服务注册、数据库连接超时等线上问题,保障业务稳定运行。
| 角色 | 职位 |
| 负责人 | 中级运维工程师 |
| 队员 | 前端工程师 |
| 队员 | 后端工程师 |