NVIDIA GB300 NVL72 利用 Ray Placement Groups 提升 AI 性能
NVIDIA 的 GB300 NVL72 是一个机架级 AI 平台,每个机架集成了 72 个 Blackwell Ultra GPU 和 36 个 Grace CPU。现在,通过 Ray 引入的 NVLink Domain-Aware Placement Groups,这个平台变得更加强大。这项新的调度功能于 2026 年 8 月 13 日发布,允许用户通过将进程放置在单个 NVLink 域内来优化 GPU 工作负载,从而为大规模 AI 应用程序解锁显著的性能提升。
GB300 NVL72 代表了 NVIDIA 迄今为止最先进的机架级架构,每个机架提供高达 1.1 exaFLOPS 的 FP4 密度计算能力。利用 NVLink 5,每个 GPU 实现了 1,800 GB/s 的全互联带宽,使所有 72 个 GPU 可以像一个统一的计算单元一样无缝通信。该平台专为超大规模 AI 工作负载设计,包括大型语言模型训练、生成式 AI 推理和自主 AI 应用。
为什么 NVLink Domain-Aware Placement Groups 重要
在此更新之前,Ray 的 placement groups 仅处理节点级别的调度,这可能导致像 GB300 这样的多机架设置中出现效率低下的问题。新的 placement groups 增加了拓扑感知功能,确保 GPU 密集型训练或推理工作负载等紧密耦合的任务保持在同一 NVLink 域内。这避免了较慢的跨节点通信,并最大化利用 GB300 高带宽 NVLink 架构的优势。
例如,NVIDIA 的 GEAR 研究实验室在 GB300 集群上测试了这一功能,用于大规模视觉语言动作 (VLA) 预训练工作负载。当使用 NVLink Domain-Aware Placement Groups 时,系统每秒迭代速度比传统 placement 方法快 1.13 倍。这种改进来自于 GPU 间通信的开销减少,因为执行体被保持在同一 NVLink 域内。
对 AI 和 HPC 的意义
GB300 NVL72 将自己定位为超大规模 AI 系统的关键工具。通过将其先进的硬件与 Ray 的新调度能力结合起来,企业现在可以更好地利用 GB300 来完成诸如万亿参数模型推理和强化学习等高要求任务。NVIDIA 的进步与对 AI 超级计算机日益增长的需求相一致,比如 2025 年微软 Azure 集群部署的 4,600 多个 GB300 GPU。
此次更新还简化了容错能力。当 NVLink 域内的一个节点发生故障时,Ray 可以自动在同一机架内重新调度工作负载,从而保持性能并将停机时间降到最低。此前,这种级别的容错调度需要手动标记,容易出错且效率低下。
NVIDIA 和 Ray 的下一步
NVIDIA 和 Ray 的开发人员已经在计划对这一功能的增强。未来的更新将支持分层拓扑结构,例如数据中心级别的调度,并引入额外的 placement 策略,如 STRICT_SPREAD,用于将工作负载分布到多个机架。这些发展可能会进一步优化 GB300 的部署,特别是在涉及混合 AI 工作负载的场景中。
随着 NVIDIA 继续主导 AI 硬件市场,GB300 NVL72 与 Ray 的集成突显了硬件和软件创新在扩展 AI 系统中的重要性。交易员和科技投资者也许可以关注 NVIDIA 的市场地位,因为截至 2026 年 8 月 13 日,其股票表现出了韧性,最近以 225.32 美元的价格交易,并实现了 0.55% 的日涨幅。
对于开发人员来说,Ray 的 NVLink Domain-Aware Placement Groups 现已可用。文档和 API 详细信息可以在 Ray 项目网站 上找到,NVIDIA 鼓励社区提供反馈以改进和扩展其功能。