一、业务服务改造、上云,不同公有云之间迁移
1. 需求:解决业务服务繁多,不方便维护、升级;提高应用快速扩展性,灵活变配;为节约成本,公有云之间迁移
2. 方案设计与实施
1) 结合企业应用场景,架构组和OPS探研、确定使用consul、Apollo、kong,APM工具使用pinpoint
2) 业务服务逐步接入业务consul、Apollo、kong、pinpoint,及时发现问题并解决问题
3) 成本、管理便捷性评估后确定:测试、压测环境、生产部分业务依次迁移至阿里云,改造存储方案(阿里云nas);
4) 公有云所有资源和中间件(es、kafka、rabbitmq等)迁移方案制定,并实施
3. 总结归档:将项目方案资料整理,并写总结文档
二、ELK集群搭建与维护
1. 需求:解决开发不登录服务器可以查看日志;减少操作系统操作人员,规避风险;问题定位效率低
2. 方案设计与实施:
1) ELK搭建(filebeat+kafka+logstash+es+kibana),集成LDAP用户认证
2) 搭建完毕,将开发和运维相关日志收集到ELK集群中,自定义dashboard和报警机制,开发使用验证
3) 开发验证无误,并确定ES中保留日志索引的时间
3. 总结归档:将项目方案资料整理,并写总结文档
三、CICD流程梳理、改造
1. 需求:解决服务交付时间长,交付质量差
2. 方案设计与实施:
1) gitlab代码库部署,项目管理;Jenkins持续集成,权限管控,项目矩阵权限划分
2) Jenkins和git配置LDAP登录,cicd流程梳理改造,提高服务交付效率(gitlab+maven+Jenkins+ansible)
3) 设定gitlab用户管理体系,提高代码安全性
3. 总结归档:将项目方案资料整理,并写总结文档
四、K8s架构设计、实践
1. 需求:微服务架构接入k8s架构
2. 方案设计与实施:
1) dev、test、uat、prod的k8s环境规划、架构部署,公共组件设计、运维
2) 配合开发服务改造,将服务逐步接入k8s集群
3) 改造cicd流程,保障服务高效交付到k8s’Prometheus高可用环境
4) dev、test、uat环境验证通过后,上prod环境
3. 总结归档:将项目方案资料整理,并写总结文档
四、建立、完善监控体系
1. 需求:解决不能实时知晓服务器和软件服务的动态,当服务器或服务出现问题会给公司造成直接损失,问题排查时间长
2. 方案设计与实施:
1) 硬件监控:制定相对应的监控方案公司服务器硬件、 系统、网络、应用监控,采用zabbix proxy架构
2) 业务/中间件监控:Prometheus高可用架构——prometheus+thanos+对象存储(minio)+grafana
3) 写自定义监控脚本监控并实时报警,结合grafana做展示,并集成ldap
4) apm工具:程序调用链监控方案选型确定,采用pinpoint并设计、搭建高可用架构
3. 总结归档:将项目方案资料整理,并写总结文档
五、权限管控,审计平台上线:开源跳板机jumpserver
1. 需求:统一登录服务器的入口,服务器免密登录,密码不可见,不同用户拥有不同权限,操作记录可审计
2. 方案设计与实施:
1) 使用开源的jumpserver作为跳板机,可实现上述功能,还有方便管理控制的功能
2) 单机版、分布式部署,集成LDAP用户认证,服务器使用树形结构管理
3. 总结归档:将项目方案资料整理,并写总结文档