1. 企业级云原生可观测性平台
主导设计并实现了基于 Go 的轻量级数据采集器,兼容 Prometheus 指标、OpenTelemetry 链路追踪及日志流,通过 Operator 模式在 Kubernetes 上完成自动发现与配置热加载。存储层采用 分布式时序数据库(如 M3DB/Thanos)处理每日 PB 级的指标写入,查询平均延迟低于 200ms。针对多集群场景,自研了联邦分级存储与全局聚合查询引擎,解决了跨云、跨机房监控数据孤岛问题。该项目体现了对云原生生态、Go 高并发及分布式存储设计的掌控力。
2. 大模型高性能推理网关(AI Infra)
为支撑千亿参数 LLM 的线上服务,基于 Python 与 vLLM/TensorRT-LLM 构建推理加速层,实现 PagedAttention 显存优化与连续批处理(Continuous Batching)。在服务侧,用 Go 开发无状态推理网关,集成请求动态路由、优先级队列(基于令牌桶与公平调度)及流式响应聚合。通过 NVIDIA Triton Inference Server管理异构 GPU(A100/H800)池,并利用 Kubeflow 完成模型的蓝绿部署与自动扩缩容(基于 GPU 利用率与队列长度)。此外,研发了专用的模型预热与缓存机制,将首 Token 延迟降低 40%。该项目充分展示了您在大模型服务化、GPU 资源调度及高性能推理方面的工程能力。
3. 分布式数据同步系统(支持万级节点)
为解决多数据中心间海量小文件与元数据的实时同步需求,自研了基于 Go 的 P2P 同步组件,采用 Raft 一致性协议管理同步任务配置,并借鉴 Gossip 协议实现节点状态传播。系统支持增量变更捕获(类似 CDC)、断点续传与数据校验(Merkle Tree 差分),单集群可承载 1w+ 节点同时同步,吞吐量达 5w+ 事件/秒。针对跨海弱网场景,实现了自适应拥塞控制与传输压缩(LZ4/Zstd),并通过 Shell 脚本封装了灰度上线与故障自愈工具链。该项目凸显了您在大规模分布式共识、网络优化及系统鲁棒性设计上的经验。