ID:426208

2

算力中心运维工程师

  • 公司信息:
  • 北京伟仕佳杰信息技术服务有限公司
  • 工作经验:
  • 4年
  • 兼职日薪:
  • 500元/8小时
  • 兼职时间:
  • 下班后
  • 周六
  • 周日
  • 可工作日远程
  • 所在区域:
  • 成都
  • 高新

技术能力

熟悉各种互联网架构,熟练运用CI/CD提高部署效率5-10倍;运用自动化工具管理1000台+服务器; 技术栈: 熟悉Linux 操作系统使用,有丰富 Ubuntu/CentOS/RedHat 系统使用经验; 掌握阿里云、腾讯云、金山云、GCP、AWS、Azure等公有云平台的使用和维护; 熟练掌握 Docker/Kubernetes/Helm/Helmfile 等容器技术;K8s弹性自动扩缩容; Github action 和Fluxcd gitops流程; 熟悉 KVM/Vmware/Zstack/OVS/Openstack 等虚拟化技术; 熟悉 Nvidia/ORIN 等 AMD 和 ARM架构的 GPU 系统维护; 具备Shell/Python/Go 脚本开发能力,熟悉 Gin框架和 Orm库,了解 Grpc协议; 具备Jenkins/Gitlab CI/Tekton/Argocd/Opentelemetry/Jaeger 等工具使用及运维; 具备Nginx/Tomcat/Mysql/ActiceMQ/RabbitMQ/Kafka 等常见开源组件部署运维; 具备Zabbix/Prometheus/Victoriametrics/Grafana/CDH/Ambari/ELK 等开源运维工具和集群运维; 掌握Smokeping/Iperf 网络性能测试工具,熟练运用 Iftop/Iotop/Tcpdump/Wireshark 进行性能分析; 掌握Ansible/Jumpserver/Puppet/Fabric 自动化运维工具的使用;

项目经验

容器自动化部署系统
项⽬背景
原有传统部署模式存在明显弊端,业务版本迭代更新频繁、跨部门协作流程繁琐、研发测试生产环境一致性差、部署报错率高,严重拖累项目迭代
进度与交付质量。为解决上述痛点,引入容器化技术,依托阿里云效搭建完整 CI/CD 自动化发布平台,统一业务交付标准,大幅提升安全服务研发测
试、上线交付的整体效率与稳定性。 项⽬职责
独立部署配置阿里云效代码管理与流水线平台、Jenkins 持续集成工具、Docker 容器运行环境,完成基础运维架构搭建、环境调试与权限配置,支撑
20+安全业务项目统一托管与部署。
基于阿里云效 Webhooks 机制,完成云效代码仓库与 Jenkins 深度联动集成,搭建代码提交、自动拉取、编译构建、自动化测试、镜像打包全流程 CI/CD
流水线,实现代码提交自动触发构建部署,无需人工干预。
规范化编写标准化 Dockerfile,统一业务应用打包规范,彻底解决多环境依赖冲突问题;搭建本地 Harbor 私有镜像仓库,完成百余个业务镜像的分类
存储、版本管理与权限管控,实现镜像高效复用与安全管控。
通过 Jenkins 可视化面板结合云效后台,实时监控流水线构建、测试、部署全流程进度,及时拦截构建异常、代码报错、部署失败等问题,累计排查优
化 30+次流水线故障,保障项目交付质量与服务稳定性。 项⽬成效
搭建完成自动化容器发布平台,将原有 2-3 小时人工部署流程压缩至 5 分钟内完成,单项目发布效率提升 90%+,极大加快安全业务版本迭代速度。
依托阿里云效实现代码集中化、版本化管理,规范代码提交、分支合并、版本迭代流程,有效降低代码冲突、版本混乱问题,跨团队协作故障率下降
75%。
借助 Docker 容器化技术,彻底统一开发、测试、生产三套环境,环境配置类故障减少 95%,实现应用一键迁移、快速部署,大幅降低运维成本与环
境调试耗时。



Prometheus+Grafana 构建运维监控一体化项目
项目背景
为应对微服务架构带来的监控复杂性,解决传统监控工具在云原生环境下指标采集不全面、告警不及时、可视化程度低等痛点,牵头构建了以
Prometheus 为核心的现代化监控告警体系。该平台实现了从基础设施到应用服务的多维度、一体化监控,为研发团队提供了强大的可观测性能力,
保障了复杂分布式系统的稳定运行
项目职责
设计分层式云原生监控架构,覆盖节点、Pod、容器、CPU/内存/磁盘/网络、延迟等 50+核心监控指标,实现 K8s 集群全方位监控覆盖。
基于 Kubernetes 集群完整部署 Prometheus、Grafana、Alertmanager、node-exporter 等组件,完成持久化存储、服务发现、自动抓取配置,监
控服务整体可用性达 99.95%。
自定义配置 30+条告警规则,涵盖节点宕机、Pod 重启、资源超载、接口报错、响应超时等场景,支持钉钉实时推送告警信息。
在 Grafana 自研搭建 5 套核心可视化大屏,分别为集群总览、节点监控、容器监控、业务接口监控、告警统计大盘,直观展示集群运行状态。
持续迭代优化监控规则与面板,清理无效指标、优化抓取频率,将监控数据延迟从秒级优化至 500ms 内,大幅提升实时性。
输出完整部署运维文档与配置手册,规范监控上线流程,支持团队快速复用与集群扩容部署。
项目成效
实现集群全维度可视化监控,集群问题盲区减少 90%,运维人员可实时掌握节点、容器、服务运行状态。
通过 Alertmanager 实时异常告警,故障发现时长由原来平均 15 分钟缩短至 30 秒内,整体故障处理效率提升 60%+。
基于监控数据分析资源负载,配合 HPA 弹性策略动态扩缩容,集群闲置资源占用降低 35%,有效节约服务器资源成本。
监控体系上线后,集群异常故障率下降 40%,服务稳定性显著提升,保障业务 7×24 小时平稳连续运行。



客户现场合规化部署智能一键交付系统
项目背景
中科慧源的业务覆盖金融、政务、能源等关键行业。其客户有三大痛点:需符合等保 2.0、数据安全法的强合规要求; 核心服务器禁用外网的封闭环
境;需搭建多类节点的集群部署需求。此前部署安全系统时,公司面临三方面问题:客户 无外网,在线下载易中断且有安全隐患;客户现场服务器多
且需人工配置,易因操作误差引人工风险;现场故障需研发远程支持,排查效率低,可能影响客户安全业务。为解决痛点、保障合规,公司制定“客户
现场合规化部署智能一键交付系统“项目,目标是打造安全、高效、可复用的标准化交付工具,支撑核心安全产品快速落地。
项⽬职责
将适配客户环境的 ansible 脚

案例展示

  • 容器自动化部署系统

    容器自动化部署系统

    项⽬背景 原有传统部署模式存在明显弊端,业务版本迭代更新频繁、跨部门协作流程繁琐、研发测试生产环境一致性差、部署报错率高,严重拖累项目迭代 进度与交付质量。为解决上述痛点,引入容器化技术,依托阿里云效搭建完整 CI/CD 自动化发布平台,统一业务交付标准,大幅提升安全服务研发

  • 客户现场合规化部署智能一键交付系统

    客户现场合规化部署智能一键交付系统

    中科慧源的业务覆盖金融、政务、能源等关键行业。其客户有三大痛点:需符合等保 2.0、数据安全法的强合规要求; 核心服务器禁用外网的封闭环 境;需搭建多类节点的集群部署需求。此前部署安全系统时,公司面临三方面问题:客户 无外网,在线下载易中断且有安全隐患;客户现场服务器多 且需

  • 构建运维监控一体化项目

    构建运维监控一体化项目

    为应对微服务架构带来的监控复杂性,解决传统监控工具在云原生环境下指标采集不全面、告警不及时、可视化程度低等痛点,牵头构建了以 Prometheus 为核心的现代化监控告警体系。该平台实现了从基础设施到应用服务的多维度、一体化监控,为研发团队提供了强大的可观测性能力, 保障了复

查看案例列表(含更多 0 个案例)

相似人才推荐

信用行为

  • 接单
    0
  • 评价
    0
  • 收藏
    0
微信扫码,建群沟通

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在1小时内与您联系,1小时内精准确定人才

微信接收人才推送

关注猿急送微信平台,接收实时人才推送

接收人才推送
联系需求方端客服
联系需求方端客服