10 年 DevOps / SRE / 中间件运维经验,专注于 Kubernetes 集群架构与中间件高可用运维。
能从源码层面理解 K8s 调度器、控制器、kubelet 工作机制。
擅长中间件(MySQL / Redis / ES / Kafka / RabbitMQ)的集群部署、性能调优、故障排查。
技术栈:
容器与编排
Kubernetes(调度器策略、QoS、HPA/VPA、Pod 拓扑约束)
Docker / containerd
Helm / Kustomize
Operator / controller-runtime 开发
中间件运维
MySQL / MariaDB(主从复制、MGR、分库分表、备份恢复、慢查询优化)
Redis(主从、Sentinel、Cluster、持久化策略、缓存击穿/穿透/雪崩)
Elasticsearch(集群管理、索引优化、分片策略、冷热架构、ELK 生态)
MongoDB(副本集、分片集群)
Kafka / RabbitMQ(集群部署、Topic 分区、消费组管理、消息堆积排查)
Nginx(反向代理、负载均衡、限流、缓存策略)
CI/CD
GitLab CI / GitHub Actions
ArgoCD / Flux(GitOps)
Jenkins
监控与可观测性
Prometheus / Thanos / VictoriaMetrics
Grafana / Alertmanager
ELK / Loki / Grafana Tempo
OpenTelemetry
MySQL Exporter / Redis Exporter / ES Exporter
基础设施即代码
Terraform / OpenTofu
Ansible
Crossplane
网络
Calico / Cilium(eBPF)
Ingress-Nginx / Traefik / Istio
CoreDNS / 网络策略
存
项目一:大规模 Kubernetes 集群架构设计与优化
规模:200+ 节点,5000+ Pod,承载 3 条核心业务线
职责与技术细节:
1. 多集群架构设计
- 设计同城双活 + 异地灾备的多集群架构,采用 KubeFed 进行跨集群负载调度
- etcd 性能调优:独立磁盘部署、调大 quota-backend-bytes、启用 --auto-compaction,解决大规模集群 etcd 读写瓶颈
- 集群分级策略:核心业务独享节点池,非核心业务共享池 + ResourceQuota + LimitRange 限制
2. 调度策略定制
- NodeAffinity + TopologySpreadConstraints 实现业务跨可用区分散部署
- PriorityClass + Preemption 保障核心业务资源紧张时优先调度
- Descheduler 定期驱逐低利用率 Pod,回收碎片化资源
- 配置 PodDisruptionBudget 保障维护期间服务可用性
- 集群资源利用率从 25% 提升至 55%
3. 自动扩缩容体系
- HPA 基于 CPU / 内存 / 自定义指标实现业务弹性伸缩
- Kafka 消费滞后指标通过 Prometheus Adapter 暴露为自定义指标,触发消费者自动扩容
- Cluster Autoscaler 配合云厂商 API 实现节点级弹性扩缩
- VPA 用于 Stateless 服务资源推荐,避免过度分配
4. 监控可观测性
- Prometheus + Thanos 多集群统一监控,长期存储 90 天指标数据
- Grafana 大屏覆盖集群健康度、Pod 调度延迟、节点资源水位、中间件关键指标
- Alertmanager 分级告警(P0 电话 / P1 钉钉 / P2 邮件),告警收敛规则减少 70% 噪音
- Loki + Promtail 收集应用日志,Grafana Tempo 链路追踪
5. Operator 开发
- Go + controller-runtime 编写数据库集群运维 Operator,实现备份、扩缩容、故障切换自动化
- CRD 定义集群规格,Reconcile 循环确保实际状态收敛到期望状态
- Leader election 保障 Operator 自身高可用
成果:
- 资源利用率提升 120%,同样资源承载更多业务
- 年度故障次数从 12 次降至 2 次
- 部署效率提升 80%(30 分钟降至 5 分钟)
- 告警噪音减少 70%,MTTR 从 45 分钟降至 15 分钟
项目二:AI 基础设施搭建与多模型 API 聚合网关
规模:对接 10+ 大模型 API,日均处理百万级 Token 请求
职责与技术细节:
1. 多模型聚合网关部署
- 基于 new-api 构建多模型聚合网关,后端 Docker Compose 部署(MySQL + Redis)
- 对接 OpenAI、Claude、Gemini、讯飞星火、百度千帆等国内外大模型 API
- 统一 OpenAI 兼容协议对外暴露,客户端无需适配不同厂商 SDK
- 后端数据库从 MySQL 迁移至 PostgreSQL,解决 JSON 字段查询性能问题
2. 流量治理与高可用
- OpenResty 做反向代理,配置多 Key 负载均衡 + 自动故障转移
- 流式 SSE 与非流式 JSON 混合处理:利用 X-Accel-Buffering 机制自动区分,非流式响应 gzip 压缩,出方向流量降低 56%
- 自研 Go 代理层实现令牌桶限流(TokenBucket),支持 SSE 流式请求分级超时控制
- 渠道级 Rate Limit + 模型路由策略,按请求内容自动路由到最优模型
基于 new-api 构建了一套多模型 API 聚合网关平台,为团队和外部客户提供统一的大模型 API 接入服务。 平台核心功能包括多模型统一接入、流量治理、计费运营和监控运维四个模块。多模型接入方面,网关对接了 OpenAI、Claude、Gemini 及
项目:翼辉信息企业官网平台(acoinfo.com) 规模:企业级 B2B 官网,涵盖产品展示、行业方案、新闻动态、开发者中心等多模块 1. 整体架构 基于阿里云构建分层架构:CDN 边缘加速 → SLB 弹性负载均衡 → OpenRest