为保证内部服务器和各项业务应用的可靠性与故障排查修复的及时性,我们对集群和业务提供了灵活的监控配置。依赖openfalcon框架,提供了硬件监控、kafka监控、es节点监控、API健康检查等常用监控,并对告警逻辑进行二次开发,扩展了对日志监控的支持。
项目职责:
1.分布式部署openfalcon框架,利用supervisord实现系统的自监控与自恢复。
2.根据产品设计,实现权限管理,告警规则优化,API监控与日志监控配置相关的Python后端开发。
3.开发并维护,API监控、ES监控、kafia监控等监控组件,实现自监控。
4.对话用户,根据用户痛点优化日志监控配置,协调资源,推动告警模板和告警示例功能的开发与上线。
项目业绩:
持续监控近300台服务器,300个API服务,300+个日志监控,平均每周产生1w多个告警,为开发人员提供<500ms的及时告警;为部门内的业务开发与故障解决,提效至少30%。
服务中台:统一用户认证中心,分布式配置管理,API网关路由与
开发背景:工厂生产的成品需要经过出厂扫描把数据传到WMS系统
行业场景 每月的员工工资条从原有的企微应用“用友工资条”
行业场景 公司缺少车辆管理及客人行程系统,所有的资料都是线
企业内部的私有化AI Agent 平台,多模型统一接入、企业
本项目为一套面向企业内部使用的 行政高效福利平台移动端界面设
需求方专属客服,免费梳理匹配
添加客服微信,免费为您安排与该工程师直接沟通
长按二维码添加客服微信
如当前档期不合,也可免费为您推荐相似案例作者