项目一:大规模 Kubernetes 集群架构设计与优化
规模:200+ 节点,5000+ Pod,承载 3 条核心业务线
职责与技术细节:
1. 多集群架构设计
- 设计同城双活 + 异地灾备的多集群架构,采用 KubeFed 进行跨集群负载调度
- etcd 性能调优:独立磁盘部署、调大 quota-backend-bytes、启用 --auto-compaction,解决大规模集群 etcd 读写瓶颈
- 集群分级策略:核心业务独享节点池,非核心业务共享池 + ResourceQuota + LimitRange 限制
2. 调度策略定制
- NodeAffinity + TopologySpreadConstraints 实现业务跨可用区分散部署
- PriorityClass + Preemption 保障核心业务资源紧张时优先调度
- Descheduler 定期驱逐低利用率 Pod,回收碎片化资源
- 配置 PodDisruptionBudget 保障维护期间服务可用性
- 集群资源利用率从 25% 提升至 55%
3. 自动扩缩容体系
- HPA 基于 CPU / 内存 / 自定义指标实现业务弹性伸缩
- Kafka 消费滞后指标通过 Prometheus Adapter 暴露为自定义指标,触发消费者自动扩容
- Cluster Autoscaler 配合云厂商 API 实现节点级弹性扩缩
- VPA 用于 Stateless 服务资源推荐,避免过度分配
4. 监控可观测性
- Prometheus + Thanos 多集群统一监控,长期存储 90 天指标数据
- Grafana 大屏覆盖集群健康度、Pod 调度延迟、节点资源水位、中间件关键指标
- Alertmanager 分级告警(P0 电话 / P1 钉钉 / P2 邮件),告警收敛规则减少 70% 噪音
- Loki + Promtail 收集应用日志,Grafana Tempo 链路追踪
5. Operator 开发
- Go + controller-runtime 编写数据库集群运维 Operator,实现备份、扩缩容、故障切换自动化
- CRD 定义集群规格,Reconcile 循环确保实际状态收敛到期望状态
- Leader election 保障 Operator 自身高可用
成果:
- 资源利用率提升 120%,同样资源承载更多业务
- 年度故障次数从 12 次降至 2 次
- 部署效率提升 80%(30 分钟降至 5 分钟)
- 告警噪音减少 70%,MTTR 从 45 分钟降至 15 分钟
项目二:AI 基础设施搭建与多模型 API 聚合网关
规模:对接 10+ 大模型 API,日均处理百万级 Token 请求
职责与技术细节:
1. 多模型聚合网关部署
- 基于 new-api 构建多模型聚合网关,后端 Docker Compose 部署(MySQL + Redis)
- 对接 OpenAI、Claude、Gemini、讯飞星火、百度千帆等国内外大模型 API
- 统一 OpenAI 兼容协议对外暴露,客户端无需适配不同厂商 SDK
- 后端数据库从 MySQL 迁移至 PostgreSQL,解决 JSON 字段查询性能问题
2. 流量治理与高可用
- OpenResty 做反向代理,配置多 Key 负载均衡 + 自动故障转移
- 流式 SSE 与非流式 JSON 混合处理:利用 X-Accel-Buffering 机制自动区分,非流式响应 gzip 压缩,出方向流量降低 56%
- 自研 Go 代理层实现令牌桶限流(TokenBucket),支持 SSE 流式请求分级超时控制
- 渠道级 Rate Limit + 模型路由策略,按请求内容自动路由到最优模型