项目工具:Python3.9 vue2 element-ui django3.2 drf tornado
项目背景: 在工作中随着深入发展一些运维的问题,如资源不统一,导致需要登录个各个不同的云平台,还有一些重复性的 运维工作。
项目实施:
1、调研当前运维有哪些重复性工作
2、选择语言以及框架进行搭建整个架构
3、负责数据库表结构设计
4、负责前端和后端的前期开发如 资产管理,穿透管理,打包工具,用户管理,网关管理,全局配置等
5、功能测试
部署 GPU到k8s集群
项目描述:开发一套新的发票识别系统 项目背景:由于识别核心不是很稳定,导致碰到一些不可以识别的票,系统崩溃,本身这套识别系统也是跑在 docker中,基于 前面上线的 devops 流水线,决定把 GPU 业务上线到k8s,这样方便管理更新 k8s有健康检查,当我识别系统,我采用访问接口的方法,来检查我的服务是否崩溃,如果不可访问,会切换到其他 pod ,进 行提供服务,k8s会试着重启崩溃的 pod 服务,如果在规定时间内,没有重启,会驱逐我的 pod ,重新拉起一个新的 pod 2.k8s方面更新,我每次更新时候只需要把镜像上传到镜像仓库,更改一下 yaml 文件镜像版本,进行 apply,k8s会重新拉取镜 像部署
3.可以节省资源,还可以生成副本,如果我一个 pod 不可以用,切换到另一个 pod ,还可以提供服务
项目步骤:
1. k8s本身不知道 gpu 集群调度,需要采用 nvidia 插件,在每一个节点上启动一个 pod ,类似于网络插件原理,共享命名空间 2. 部署项目,试运行,停止原服务,采用k8s提供服务等