Copied


NVIDIA 的 KAI Scheduler 和 vCluster 实现 Kubernetes 中的 GPU 共享

realtime news   Aug 03, 2026 16:30 1 Min Read


NVIDIA 发布了一个强大的框架,用于在共享 GPU 基础设施上运行隔离的 Kubernetes 集群,结合 KAI Scheduler 和 vCluster。这种设置允许多个 AI/ML 团队高效地共享 GPU 资源,同时不影响自主性,为专用集群提供了一种具有成本效益的替代方案。这种方法专为管理高 GPU 工作负载(如 AI 模型训练或推理)的组织设计,提供了可扩展性和隔离性。

关键的创新点在于将 KAI Scheduler(一种拓扑感知的 GPU 调度器)与 vCluster(一种用于配置隔离 Kubernetes 集群的工具)相结合。通过集成这些工具,团队可以获得专用的 Kubernetes 控制平面,同时共享底层 GPU 硬件。在 AI 基础设施中,GPU 短缺和高成本仍然是紧迫问题,这种解决方案可以显著优化资源利用率。

它如何工作

其架构围绕由单个 Kubernetes 集群管理的共享 GPU 池展开。每个团队分配一个虚拟集群(vCluster),配有自己的 API 服务器、自定义资源定义(CRDs)和基于角色的访问控制(RBAC)。这种设置在巩固物理资源的同时隔离工作负载。团队可以独立管理其环境——对于需要自定义配置的用例(如不同的 Kubeflow 版本或独特的 CRD 实现)而言至关重要。

KAI Scheduler 在动态分配 GPU 资源中发挥核心作用。通过使用分层队列,它确保资源的公平分配,同时允许未使用的 GPU 容量被重新分配给其他团队。例如,三个专注于 NLP、计算机视觉和推荐系统的 AI 团队可以共享一块 NVIDIA L40S GPU,每个团队保证一部分 GPU 资源,同时在空闲期间还能利用额外容量。

可扩展性和效率

这一解决方案是为可扩展性而设计的。尽管教程设置使用了单块 GPU,但相同的原则适用于拥有数百个 GPU 节点和多个租户团队的更大集群。NVIDIA 对资源优化的关注反映了 AI/ML 基础设施对“以更少资源完成更多任务”的日益增长的需求。对于扩展 AI 工作负载的组织而言,这种方法可以降低硬件成本并简化操作复杂性。

为了增强隔离性,可以集成 NVIDIA 的多实例 GPU(MIG)技术,提供硬件级别的分区。这对不可信租户或需要在节点、网络或存储级别严格隔离的场景特别有用。

应用及意义

在维护隔离环境的同时高效共享 GPU 的能力在 AI 密集型行业中具有广泛的应用。研究机构、初创企业和开发 AI 模型的企业能够在不牺牲灵活性的前提下降低基础设施成本。此外,这种方法与企业 IT 中对平台工程和云原生解决方案日益重视的趋势相一致。

截至 2026 年 8 月,目前没有直接与这些技术相关的加密货币或公开交易的数字资产。然而,NVIDIA 在 GPU 硬件和软件领域的持续进步可能会影响 AI 和云计算领域的更广泛市场动态。

展望未来

NVIDIA 的 KAI Scheduler 和 vCluster 以开源工具的形式提供,使开发者能够在多样化的 Kubernetes 环境中进行实验和部署这些功能。对于有兴趣动手探索的组织,可以从 NVIDIA GPU Operator 等工具入手,该工具简化了 Kubernetes 集群中的 GPU 管理。

欲了解更多信息,NVIDIA 计划在 2026 年 11 月 9 日至 12 日的北美 KubeCon 大会上展示这一集成。该活动可能会吸引平台工程师和 AI/ML 从业者,他们渴望优化基础设施以应对日益增长的工作负载。

准备好增强您的 AI 基础设施了吗?在 GitHub 上探索这些工具:KAI SchedulervCluster,以及 NVIDIA GPU Operator


Read More