NVIDIA的NVCRE通过实际工作负载验证提升AI集群可靠性
NVIDIA推出了集群就绪引擎(NVCRE),这是一款基于Kubernetes的开源工具,旨在确保GPU集群为AI工作负载的需求做好生产准备。通过运行实际的分布式任务,例如训练基准测试和通信测试,NVCRE能够识别性能不佳的节点、硬件退化以及标准诊断可能遗漏的配置问题。
AI训练任务通常会因为一些微妙的问题而失败或表现不佳,比如单个GPU速度过慢或流量路由配置错误。NVCRE通过主动运行拓扑感知测试、测量结果并在工作负载上线前诊断问题来解决这些问题。例如,在一次512个GPU的训练运行中,单个瓶颈常常拖慢整个操作。利用NVCRE,团队可以精确定位导致问题的节点或链接,从而节省数天的故障排查时间。
NVCRE的工作原理
NVCRE的核心是作为Kubernetes控制器运行,使用Certification、Workflow和Job等自定义资源。这些资源组织了测试过程,包括定义目标节点、执行分布式任务以及以机器可读的方式报告故障原因。例如,某项测试可能会标记节点gpu-node-07存在带宽问题,或标记另一节点存在硬件退化。
该工具旨在对大规模集群进行测试,支持节点内、机架内和全规模测试的配置。NVCRE的自适应故障隔离功能自动化了多节点故障中问题的缩小范围,这一任务在其他情况下可能需要大量的工程时间。
应用与市场需求
NVCRE的发布正值大规模AI基础设施需求激增之际。NVIDIA最近的文档强调了NVCRE对云服务提供商、基础设施团队以及运行GPU密集型AI操作的企业的实用性。应用场景包括预生产验收测试、烧机认证和分布式训练验证。
随着AI工作负载日益复杂,确保集群就绪性至关重要。一个小失误——无论是故障GPU还是被忽视的配置——都可能导致高昂的延误和效率降低。例如,NVIDIA支持NVCRE的GB300架构专为高性能AI应用设计,验证其就绪性确保团队能够充分利用其投资。
集成与生态系统
NVCRE是NVIDIA更广泛AI基础设施软件栈的补充工具。它与NVIDIA AI集群运行时(AICR)集成,后者标准化集群配置,及NVSentinel监控工具集成,提供运行时健康状态的被动监控。这些工具共同为配置、验证和监控GPU集群提供全面的解决方案。
NVCRE最新稳定版本0.3.0于2026年9月14日发布,新增功能包括Helm Chart摘要发布和Sigstore/SLSA来源以保障部署安全性。该软件支持主要云服务提供商,包括AWS、GCP和Azure,以及本地环境,使其适用于广泛的使用场景。
为什么这对AI驱动的企业至关重要
对于运行大规模AI模型的企业而言,GPU集群的停机或效率低下可能意味着数百万美元的生产力损失。NVIDIA市值5.48万亿美元,凸显了其在AI硬件和软件领域的影响力。像NVCRE这样的工具确保使用NVIDIA GPU的组织能够保持可靠性和性能,这对于在AI驱动的行业中保持竞争力至关重要。
要开始使用NVCRE,需要Kubernetes 1.29或更高版本,以及NVIDIA的GPU Operator。团队可以通过CLI安装程序或Helm Chart部署该工具,详细文档可在GitHub上获取。
展望未来
随着AI工作负载的扩展并逐步接近百亿亿次计算需求,像NVCRE这样的工具将变得不可或缺,以确保GPU集群能够提供一致、可靠的性能。NVIDIA将NVCRE定位为AI基础设施的基础工具,未来的更新可能会扩展其在推理和自动化生命周期验证方面的能力。
对于早期采用者和面临大规模AI挑战的企业而言,NVCRE提供了一种前瞻性、基于工作负载的方法,确保集群中的每个GPU都能发挥其作用。