服务器集群维护 1. 负责公司 60 台 Linux 服务器集群的规划、搭建与日常维护工作,采用 Ansible 实现服务器配置
的自动化管理,将服务器初始化时间从原来的 5 小时缩短至 5-10 分钟,大幅提升运维效率。
2. 定期对服务器进行安全基线扫描和弱口令相关材料扫描,通过扫描后返回报告进行漏洞修复,保
障业务系统安全稳定运行。
➢ 监控系统优化与故障处理
3. 对公司原有监控平台系统进行优化,扩展监控指标至 5 余项,涵盖系统资源、区块链资源、中间
件(Tomcat、Nginx)及业务接口、业务可用性等,自定义告警规则 130 余条。
4. 期间共处理各类故障 10 余次,其中包括 3 次业务服务异常中断,通过快速定位故障原因(服务
对应裸金属主机硬件异常),协调更换硬件,在 2 小时内恢复业务服务,将业务损失降至最
低;。
➢ 日常运维与系统保障
5. 负责公司 Windows 及 Linux 服务器的日常运维工作,包括系统补丁更新、用户权限管理、日志
备份与分析等,确保服务器稳定运行,期间服务器平均无故障运行时间(MTBF)达到 60 天以
上。
6. 协助开发团队解决开发、测试环境中的各类运维相关问题,如环境配置、服务部署等,保障开发
测试工作的顺利进行,获得开发团队的一致认可。
➢ 数据备份与恢复
7. 协助数据库同事制定并执行公司数据库(MySQL、panweiDB)及业务数据的备份策略,采用定
时备份与异地备份相结合的方式,确保数据安全。
8. 协助成功处理 1 次数据误删事件,通过备份数据在 1 小时内完成数据恢复,未造成数据丢失,保
障了公司业务数据的安全性与完整性。
➢ 双月报安全保障
9. 针对公司 60 台 Linux 服务器,通过编写并执行自动化脚本(如 Shell/Python 脚本),定期开展
基线安全扫描(含系统配置合规性、端口开放合规性等)与弱口令检测,自动生成包含风险项、
风险等级及详细描述的扫描报告,确保扫描覆盖无遗漏。
10. 扫描完成后,依据生成的扫描报告,优先对高风险基线漏洞(如权限配置不当、未禁用危险服
务)进行针对性修复,同步更新弱口令(强制替换弱密码并配置密码复杂度策略),修复后二次
验证扫描结果,形成 “扫描 - 修复 - 验证” 的闭环,持续保障业务主机的运行安全性。