SaaS企业级监控系统从0到1建设(2021.06-2021.11) 技术挑战:原有监控体系分散在Zabbix/Prometheus/ELK多套系统,告警风暴导致MTTR(平均修复时间)长达2小时 解决方案: 统一监控平台架构设计:采用Prometheus+Grafana作为核心,通过Thanos实现全球多数据中心数据聚合 告警智能降噪:开发基于LSTM的异常检测模型,结合业务规则引擎,将无效告警减少76% 自动化运维闭环:集成Jenkins+Ansible,实现故障自愈脚本库(含30+场景),自愈成功率达82% 量化成果: 系统可用性从99.2%提升至99.95%,满足IS
SaaS企业级监控系统从0到1建设(2021.06-2021.11) 技术挑战:原有监控体系分散在Zabbix/Prometheus/ELK多套系统,告警风暴导致MTTR(平均修复时间)长达2小时 解决方案: 统一监控平台架构设计:采用Prometheus+Grafana作为核心,通过Thanos实现全球多数据中心数据聚合 告警智能降噪:开发基于LSTM的异常检测模型,结合业务规则引擎,将无效告警减少76% 自动化运维闭环:集成Jenkins+Ansible,实现故障自愈脚本库(含30+场景),自愈成功率达82% 量化成果: 系统可用性从99.2%提升至99.95%,满足IS
SaaS企业级监控系统从0到1建设(2021.06-2021.11) 技术挑战:原有监控体系分散在Zabbix/Prometheus/ELK多套系统,告警风暴导致MTTR(平均修复时间)长达2小时 解决方案: 统一监控平台架构设计:采用Prometheus+Grafana作为核心,通过Thanos实现全球多数据中心数据聚合 告警智能降噪:开发基于LSTM的异常检测模型,结合业务规则引擎,将无效告警减少76% 自动化运维闭环:集成Jenkins+Ansible,实现故障自愈脚本库(含30+场景),自愈成功率达82% 量化成果: 系统可用性从99.2%提升至99.95%,满足IS...
SaaS企业级监控系统从0到1建设(2021.06-2021.11) 技术挑战:原有监控体系分散在Zabbix/Prometheus/ELK多套系统,告警风暴导致MTTR(平均修复时间)长达2小时 解决方案: 统一监控平台架构设计:采用Prometheus+Grafana作为核心,通过Thanos实现全球多数据中心数据聚合 告警智能降噪:开发基于LSTM的异常检测模型,结合业务规则引擎,将无效告警减少76% 自动化运维闭环:集成Jenkins+Ansible,实现故障自愈脚本库(含30+场景),自愈成功率达82% 量化成果: 系统可用性从99.2%提升至99.95%,满足IS...
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如该工程师当前档期不合,也可免费为您推荐相似候选人