zdcloud-online

高级Devops工程师
西安翼辉爱智物联网有限公司 · 10年经验
zdcloud-online
日薪: ¥500/8h
地点: 西安 全区
时间: 下班后周六周日可工作日远程
ID:427270 复制

0
接单数
0
评价数
0
收藏数

AI 技能提取 | MySQL Redis Kafka RabbitMQ Kubernetes Nginx K8s Docker CI/CD Jenkins Ansible DevOps Terraform Elasticsearch MongoDB
10 年 DevOps / SRE / 中间件运维经验,专注于 Kubernetes 集群架构与中间件高可用运维。
能从源码层面理解 K8s 调度器、控制器、kubelet 工作机制。
擅长中间件(MySQL / Redis / ES / Kafka / RabbitMQ)的集群部署、性能调优、故障排查。

技术栈:
容器与编排
Kubernetes(调度器策略、QoS、HPA/VPA、Pod 拓扑约束)
Docker / containerd
Helm / Kustomize
Operator / controller-runtime 开发

中间件运维
MySQL / MariaDB(主从复制、MGR、分库分表、备份恢复、慢查询优化)
Redis(主从、Sentinel、Cluster、持久化策略、缓存击穿/穿透/雪崩)
Elasticsearch(集群管理、索引优化、分片策略、冷热架构、ELK 生态)
MongoDB(副本集、分片集群)
Kafka / RabbitMQ(集群部署、Topic 分区、消费组管理、消息堆积排查)
Nginx(反向代理、负载均衡、限流、缓存策略)

CI/CD
GitLab CI / GitHub Actions
ArgoCD / Flux(GitOps)
Jenkins

监控与可观测性
Prometheus / Thanos / VictoriaMetrics
Grafana / Alertmanager
ELK / Loki / Grafana Tempo
OpenTelemetry
MySQL Exporter / Redis Exporter / ES Exporter

基础设施即代码
Terraform / OpenTofu
Ansible
Crossplane

网络
Calico / Cilium(eBPF)
Ingress-Nginx / Traefik / Istio
CoreDNS / 网络策略

项目一:大规模 Kubernetes 集群架构设计与优化

规模:200+ 节点,5000+ Pod,承载 3 条核心业务线

职责与技术细节:

1. 多集群架构设计
- 设计同城双活 + 异地灾备的多集群架构,采用 KubeFed 进行跨集群负载调度
- etcd 性能调优:独立磁盘部署、调大 quota-backend-bytes、启用 --auto-compaction,解决大规模集群 etcd 读写瓶颈
- 集群分级策略:核心业务独享节点池,非核心业务共享池 + ResourceQuota + LimitRange 限制

2. 调度策略定制
- NodeAffinity + TopologySpreadConstraints 实现业务跨可用区分散部署
- PriorityClass + Preemption 保障核心业务资源紧张时优先调度
- Descheduler 定期驱逐低利用率 Pod,回收碎片化资源
- 配置 PodDisruptionBudget 保障维护期间服务可用性
- 集群资源利用率从 25% 提升至 55%

3. 自动扩缩容体系
- HPA 基于 CPU / 内存 / 自定义指标实现业务弹性伸缩
- Kafka 消费滞后指标通过 Prometheus Adapter 暴露为自定义指标,触发消费者自动扩容
- Cluster Autoscaler 配合云厂商 API 实现节点级弹性扩缩
- VPA 用于 Stateless 服务资源推荐,避免过度分配

4. 监控可观测性
- Prometheus + Thanos 多集群统一监控,长期存储 90 天指标数据
- Grafana 大屏覆盖集群健康度、Pod 调度延迟、节点资源水位、中间件关键指标
- Alertmanager 分级告警(P0 电话 / P1 钉钉 / P2 邮件),告警收敛规则减少 70% 噪音
- Loki + Promtail 收集应用日志,Grafana Tempo 链路追踪

5. Operator 开发
- Go + controller-runtime 编写数据库集群运维 Operator,实现备份、扩缩容、故障切换自动化
- CRD 定义集群规格,Reconcile 循环确保实际状态收敛到期望状态
- Leader election 保障 Operator 自身高可用

成果:
- 资源利用率提升 120%,同样资源承载更多业务
- 年度故障次数从 12 次降至 2 次
- 部署效率提升 80%(30 分钟降至 5 分钟)
- 告警噪音减少 70%,MTTR 从 45 分钟降至 15 分钟


项目二:AI 基础设施搭建与多模型 API 聚合网关

规模:对接 10+ 大模型 API,日均处理百万级 Token 请求

职责与技术细节:

1. 多模型聚合网关部署
- 基于 new-api 构建多模型聚合网关,后端 Docker Compose 部署(MySQL + Redis)
- 对接 OpenAI、Claude、Gemini、讯飞星火、百度千帆等国内外大模型 API
- 统一 OpenAI 兼容协议对外暴露,客户端无需适配不同厂商 SDK
- 后端数据库从 MySQL 迁移至 PostgreSQL,解决 JSON 字段查询性能问题

2. 流量治理与高可用
- OpenResty 做反向代理,配置多 Key 负载均衡 + 自动故障转移
- 流式 SSE 与非流式 JSON 混合处理:利用 X-Accel-Buffering 机制自动区分,非流式响应 gzip 压缩,出方向流量降低 56%
- 自研 Go 代理层实现令牌桶限流(TokenBucket),支持 SSE 流式请求分级超时控制
- 渠道级 Rate Limit + 模型路由策略,按请求内容自动路由到最优模型
zdcloud-online ID:427270 复制

zdcloud-online

高级Devops工程师 · 10年经验 · 西安翼辉爱智物联网有限公司
城市西安 全区 日薪500元/8h 时间 下班后周六周日可工作日远程
0
累计接单
0
用户评价
0
被收藏

信用行为

0
接单数
0
评价数
0
收藏数

技术能力

AI 技能提取 | MySQL Redis Kafka RabbitMQ Kubernetes Nginx K8s Docker CI/CD Jenkins Ansible DevOps Terraform Elasticsearch MongoDB
10 年 DevOps / SRE / 中间件运维经验,专注于 Kubernetes 集群架构与中间件高可用运维。
能从源码层面理解 K8s 调度器、控制器、kubelet 工作机制。
擅长中间件(MySQL / Redis / ES / Kafka / RabbitMQ)的集群部署、性能调优、故障排查。

技术栈:
容器与编排
Kubernetes(调度器策略、QoS、HPA/VPA、Pod 拓扑约束)
Docker / containerd
Helm / Kustomize
Operator / controller-runtime 开发

中间件运维
MySQL / MariaDB(主从复制、MGR、分库分表、备份恢复、慢查询优化)
Redis(主从、Sentinel、Cluster、持久化策略、缓存击穿/穿透/雪崩)
Elasticsearch(集群管理、索引优化、分片策略、冷热架构、ELK 生态)
MongoDB(副本集、分片集群)
Kafka / RabbitMQ(集群部署、Topic 分区、消费组管理、消息堆积排查)
Nginx(反向代理、负载均衡、限流、缓存策略)

CI/CD
GitLab CI / GitHub Actions
ArgoCD / Flux(GitOps)
Jenkins

监控与可观测性
Prometheus / Thanos / VictoriaMetrics
Grafana / Alertmanager
ELK / Loki / Grafana Tempo
OpenTelemetry
MySQL Exporter / Redis Exporter / ES Exporter

基础设施即代码
Terraform / OpenTofu
Ansible
Crossplane

网络
Calico / Cilium(eBPF)
Ingress-Nginx / Traefik / Istio
CoreDNS / 网络策略

项目经验

项目一:大规模 Kubernetes 集群架构设计与优化

规模:200+ 节点,5000+ Pod,承载 3 条核心业务线

职责与技术细节:

1. 多集群架构设计
- 设计同城双活 + 异地灾备的多集群架构,采用 KubeFed 进行跨集群负载调度
- etcd 性能调优:独立磁盘部署、调大 quota-backend-bytes、启用 --auto-compaction,解决大规模集群 etcd 读写瓶颈
- 集群分级策略:核心业务独享节点池,非核心业务共享池 + ResourceQuota + LimitRange 限制

2. 调度策略定制
- NodeAffinity + TopologySpreadConstraints 实现业务跨可用区分散部署
- PriorityClass + Preemption 保障核心业务资源紧张时优先调度
- Descheduler 定期驱逐低利用率 Pod,回收碎片化资源
- 配置 PodDisruptionBudget 保障维护期间服务可用性
- 集群资源利用率从 25% 提升至 55%

3. 自动扩缩容体系
- HPA 基于 CPU / 内存 / 自定义指标实现业务弹性伸缩
- Kafka 消费滞后指标通过 Prometheus Adapter 暴露为自定义指标,触发消费者自动扩容
- Cluster Autoscaler 配合云厂商 API 实现节点级弹性扩缩
- VPA 用于 Stateless 服务资源推荐,避免过度分配

4. 监控可观测性
- Prometheus + Thanos 多集群统一监控,长期存储 90 天指标数据
- Grafana 大屏覆盖集群健康度、Pod 调度延迟、节点资源水位、中间件关键指标
- Alertmanager 分级告警(P0 电话 / P1 钉钉 / P2 邮件),告警收敛规则减少 70% 噪音
- Loki + Promtail 收集应用日志,Grafana Tempo 链路追踪

5. Operator 开发
- Go + controller-runtime 编写数据库集群运维 Operator,实现备份、扩缩容、故障切换自动化
- CRD 定义集群规格,Reconcile 循环确保实际状态收敛到期望状态
- Leader election 保障 Operator 自身高可用

成果:
- 资源利用率提升 120%,同样资源承载更多业务
- 年度故障次数从 12 次降至 2 次
- 部署效率提升 80%(30 分钟降至 5 分钟)
- 告警噪音减少 70%,MTTR 从 45 分钟降至 15 分钟


项目二:AI 基础设施搭建与多模型 API 聚合网关

规模:对接 10+ 大模型 API,日均处理百万级 Token 请求

职责与技术细节:

1. 多模型聚合网关部署
- 基于 new-api 构建多模型聚合网关,后端 Docker Compose 部署(MySQL + Redis)
- 对接 OpenAI、Claude、Gemini、讯飞星火、百度千帆等国内外大模型 API
- 统一 OpenAI 兼容协议对外暴露,客户端无需适配不同厂商 SDK
- 后端数据库从 MySQL 迁移至 PostgreSQL,解决 JSON 字段查询性能问题

2. 流量治理与高可用
- OpenResty 做反向代理,配置多 Key 负载均衡 + 自动故障转移
- 流式 SSE 与非流式 JSON 混合处理:利用 X-Accel-Buffering 机制自动区分,非流式响应 gzip 压缩,出方向流量降低 56%
- 自研 Go 代理层实现令牌桶限流(TokenBucket),支持 SSE 流式请求分级超时控制
- 渠道级 Rate Limit + 模型路由策略,按请求内容自动路由到最优模型
客服二维码

没找到合适的人才?

扫码添加客服极速匹配,或直接发布需求让更多人才主动报名

平台担保交易 · 1小时内不满意可退款

平台信誉与实力

基于 35,336 需求方信任

  • 支付宝企业信用分 优秀 评级
  • 市场份额约占全行业三分之一
  • 程序员兼职行业全能首选平台
查看平台资质详情
收藏