ID:428422

J.

SRE

  • 公司信息:
  • 阿里
  • 工作经验:
  • 10年
  • 兼职日薪:
  • 1000元/8小时
  • 兼职时间:
  • 下班后
  • 周六
  • 周日
  • 可工作日远程
  • 所在区域:
  • 杭州
  • 余杭

技术能力

熟悉业务架构方面的规划
熟练掌握阿里专有云自动化运维平台的使用。
熟练掌握阿里以专有云产品的使用及资源处理。
熟练掌握Linux系统的使用和基础的Shell脚本编程。
熟练掌握常用数据库Mysql,包括常见sql操作。
熟练掌握Python、Go语言的开发使用。
熟悉Kubernetes 容器编排、Docker等技术。
熟悉nacos、xxl-job、starrocks、zookeeper等开源中间件。
熟悉常用监控产品 Prometheus、Grafana、ELK等。
熟悉基本的运维操作命令及规范流程等。
了解AI相关大模型部署等。

项目经验

大型云平台维护
项目描述:专有云区+公有云区-主备机房服务器达到2000+台
项目角色:SRE
工作内容:
1.负责云平台⽇常运维,包括但不限于云平台巡检(底座、元数据库)、云产品⽔位管理扩容、⼯单问题
排查及变更、平台⻛险点修复、故障应急处理、重⼤节⽇护航保障等,切实保障平台稳定,并依靠保障⾃
定义核⼼指标提⾼平台可⽤性。
2.协助政务云初期的运维体系建设。
3.跨团队进行产品缺陷及风险的对接,跟进固化修复情况。
4.按照产品提供的深度巡检文档编写深度巡检脚本,每月产出深度巡检月报。
5.整理常规问题的处理方法,落地形成文档与团队同步。
6.进行专有云及公有云平台飞天系统重要版本升级及平台产品Bug修复。

运维平台模块研发
项目描述:公司运维平台--监控、建站、集群容灾等功能模块研发
项目角色:运维开发
工作内容:
1、负责监控模块研发,包括结合ELK、Prometheus、Grafana集成服务器、应用、数据库、前端整
个系统的性能监控大盘。便于快速定位问题,观察资源水位,提高巡检效率等。
2、负责建站模块研发,包括基准环境标准化,优化离线出包流程及一键部署效率。加快了整体系统
交付速度。
负责集群容灾模块研发,主要针对双集群架构研发双集群切流、双集群版本对比及版本同步模
块。提高频繁批量更新应用导致故障的快速恢复能力。

his系统稳定性保障
项目描述:同城双活虚拟机达到1000+台
项目角色:项目运维负责人
工作内容:
1、负责日常研发迭代发布配置等更新
2、负责整体稳定性工作,完成双集群架构保障批量发布故障的秒级恢复能力。
3、协助完成主要his系统和三方服务迁移,并且主导完成整体his系统双集群架构及同城双活的实施方
案和建设落地。
4、优化整体系统高可靠能力,发布流程优化,完善监控告警。
5、协助完成电子病历、互联互通等各类评审工作。
6、整理输出项目标准及变更规范相关文档。
7、负责部署及整体运维多个大型医院项目系统。
8、对接售前团队,提供资源评估、架构讲解以及各类评级答疑工作。
9、完成了运维项目全周期sop相关文档,包括前期摸底、资源规划、客户问题QA文档、部署交付标准文
档等,完善了交付的整个流程标准化。

案例展示

  • 大型系统运维

    大型系统运维

    项目描述:大型医疗系统同城双活虚拟机达到1000+台 项目角色:项目运维负责人 工作内容: 1、负责日常研发迭代发布配置等更新 2、负责整体稳定性工作,完成双集群架构保障批量发布故障的秒级恢复能力。 3、协助完成主要his系统和三方服务迁移,并且主导完成整体his系统双

  • 运维平台开发

    运维平台开发

    项目描述:公司运维平台--监控、建站、集群容灾等功能模块研发 项目角色:运维开发 工作内容: 1、负责平台监控模块研发,包括结合ELK、Prometheus、Grafana集成服务器、应用、数据库、前端整个系统的性能监控大盘。便于快速定位问题,观察资源水位,提高巡检效率等。

查看案例列表(含更多 0 个案例)

信用行为

  • 接单
    0
  • 评价
    0
  • 收藏
    0
微信扫码,建群沟通

发布任务

企业点击发布任务,工程师会在任务下报名,招聘专员也会在1小时内与您联系,1小时内精准确定人才

微信接收人才推送

关注猿急送微信平台,接收实时人才推送

接收人才推送
联系需求方端客服
联系需求方端客服