Copied


NVIDIA 发布 NodeWright 用于 Kubernetes 节点管理

realtime news   Sep 23, 2026 19:25 1 Min Read


NVIDIA 正式推出了 NodeWright,这是一款开源的、原生 Kubernetes 的软件包管理器,旨在管理并安全地更新 GPU 集群中的主机操作系统。NodeWright 最初在 NVIDIA 内部以 Skyhook 的名字使用,旨在解决一个主要的操作难点:在不干扰敏感 AI 工作负载或长时间运行任务的情况下维护节点级配置。

管理 Kubernetes 节点一直是一个挑战,尤其是针对基于 GPU 的工作负载。虽然 Kubernetes 负责工作负载调度,但节点级任务——如内核调优、驱动程序更新和安全补丁应用——需要手动脚本、自定义 playbook 或中断性的维护窗口。这在规模化时变得难以接受,特别是在 GPU 等硬件稀缺且任务无法轻易重新调度的情况下。NodeWright 通过启用 声明式的集群范围更新 来解决这些问题,同时遵守 Kubernetes 的原生机制,如 PodDisruptionBudgets 和工作负载标签。

NodeWright 的工作原理

NodeWright 使用三个核心组件运作:操作器、自定义资源和软件包。管理员在 NodeWright 自定义资源 中声明所需更改,通过标签指定目标节点,并定义中断预算。被打包为容器镜像的软件包包含了从 CVE 修复到特定加速器调优任务所需的脚本和配置。操作器随后按照六步流程逐个节点协调更改:隔离、等待、排空、应用、更验证、解除隔离。

这一工作流程确保了最小的中断。例如,运行长时间 AI 训练任务的节点不会在任务中途被打断。相反,NodeWright 会暂停对受保护工作负载的更新,逐步应用更改,并在恢复操作之前验证结果。它实际上是一个 兼容 GitOps 的主机层软件包管理器,可以实现数千节点的安全、自动化部署。

用于集群管理的渐进式部署

NodeWright 的一大亮点是其 DeploymentPolicy 资源,它支持通过固定、线性或指数批次策略进行渐进式部署。这使管理员可以从一个单一的金丝雀节点开始,验证更新,然后自信地将更改扩展到整个集群。成功和失败的阈值提供了额外的保障,在出现问题时停止更新。这些控制对于大型 GPU 集群至关重要,因为即使是微小的中断也可能对生产力产生巨大影响。

为 GPU 和 AI 工作负载量身定制

NodeWright 特别适合 GPU 加速工作负载,这是 NVIDIA 拥有无与伦比专业知识的领域。该工具与 NVIDIA 的 AI 生态系统无缝集成,包括 AI 集群运行时 (AICR),它为驱动程序、内核和系统配置提供了验证的配方。NVIDIA 还发布了用于常见任务的预构建软件包,例如调优 NVIDIA Hopper 和 Blackwell GPU 或配置 Google Kubernetes Engine (GKE) 和 Amazon Elastic Kubernetes Service (EKS) 等云环境中的节点。

重要意义

对于运行 AI 工厂或 GPU 密集型 Kubernetes 集群的企业来说,NodeWright 是一个改变游戏规则的工具。它弥合了工作负载编排与节点管理之间的关键差距,将 Kubernetes 风格的自动化和声明式管理引入底层主机层。通过消除手动干预和电子表格的需求,它降低了操作风险并提高了正常运行时间。

这一时机正好符合对可扩展 AI 基础设施日益增长的需求,在节点级效率不足引起的延误可能造成数百万损失的情况下,尤为关键。NVIDIA 的开源方法确保了广泛的可访问性,邀请 Kubernetes 和 AI 社区的贡献者扩展其功能。

未来发展

NodeWright 现已作为开源项目在 Apache 2.0 许可下发布。管理员可以通过 Helm 图表安装它,并立即开始管理集群。NVIDIA 计划继续增强该平台,推出新软件包和集成,重点支持复杂的云和硬件配置。

对于大规模采用 AI 的企业来说,NodeWright 提供了一条简化操作、最小化中断并确保其 Kubernetes 集群中节点性能一致的路径。


Read More