分布式通用计算引擎(基于Ray & K8s)|核心研发
声明式集群管理:基于 K8s 纳管 Ray 集群,设计并维护 RayJob / RayCluster 声明式 CRD 编排模板,实现 Ray Head 与 Worker 节点的自动化拉起、生命周期管理与资源配额控制。
按需弹性与隔离:支持针对异构计算资源(如 Python/C++ 计算任务的依赖环境与硬件需求)实现集群资源的动态分配,有效避免多任务抢占与资源浪费。
存储与数据流转解耦:深度集成 MinIO 对象存储,实现计算任务输入文件(脚本、模型、依赖包)的统一托管与计算产出物/日志的自动归档,隔离计算节点与存储层。
轻量级 Client SDK 研发:封装独立的 Java API Client SDK,屏蔽底层 Ray REST API 及 K8s 的复杂细节,向上层业务系统提供标准化、声明式的 HTTP 交互接口。
多维资源与任务监控:对接 Ray Dashboard 及 Prometheus 监控指标,实现对集群 Head/Worker 节点健康度、CPU/内存/GPU 实时占用以及 Task/Actor 执行状态的全方位可视化监控。
异构计算统一调度:无缝打通 Java 业务系统与 Python/C++ 底层计算引擎的壁垒,实现跨语言分布式计算任务的“一键式”调度与结果自动归集。