Copied


NVIDIA NVLink 6 通过多层方法提升 AI 工厂的弹性

realtime news   Sep 15, 2026 19:24 1 Min Read


NVIDIA 发布了 NVLink 6,这是其高速互连的最新版本,旨在应对大规模 AI 工厂日益增长的基础设施需求。基于 Rubin 平台,NVLink 6 提供了一个多层弹性框架,即使在不可避免的硬件和网络错误面前,也能确保大规模 GPU 部署的持续运行和正常运行时间。

NVLink 6 架构的核心是能够在 GPU 集群间保持无损通信,这是大规模 AI 训练和推理的关键要求。每个 GPU 提供 3.6 TB/s 的双向带宽,NVLink 6 的性能是其前代 NVLink 5 的两倍,且超过 PCIe Gen6 带宽的 14 倍以上。配备 NVLink 6 的单个 72-GPU Rubin NVL72 机架可以实现前所未有的 260 TB/s 全互联带宽,为 AI 互连设立了新的基准。

跨层弹性

NVLink 6 的容错方法涵盖物理层、链路层和应用层。在物理层,互连使用轻量级的前向纠错(FEC)和物理层重试(PLR)机制,以纠正位级错误,同时不会引入显著的延迟。在链路层,添加了基于信用的流量控制(CBFC),通过主动管理网络拥堵防止数据包丢失。同时,应用层支持如 NVIDIA 的 Shadow Engine Recovery 等高级恢复功能,该功能可以在几秒钟内恢复推理操作,将停机时间从几分钟缩短到仅几秒。

这些创新使 NVLink 6 能够以最小性能影响处理瞬态错误、节点中断和链路退化。对于 AI 操作员来说,这意味着更高的生产力和更低的成本,因为在以推理为主的工作负载(如大型语言模型 LLMs)中,计划外停机会直接影响收入生成。

AI 工厂需要无妥协的正常运行时间

随着 AI 模型的规模增大和部署扩展到数千个 GPU,保持集群利用率至关重要。即使是罕见的数据包丢失也可能累积成显著的性能下降,这使得无损网络结构成为必要。NVLink 6 通过在每个层级上集成冗余来解决这些挑战,从双带外管理路径到支持热插拔的交换机托盘,允许进行非中断维护。

今年早些时候首次亮相的 Rubin 平台是 NVLink 6 部署的基础。它结合了 NVIDIA 的 Rubin GPU、Vera CPU 以及其他组件,创建了一个针对 AI 工作负载优化的统一架构。核心合作伙伴 CoreWeave 计划在 2026 年下半年将 Rubin 系统集成到其云基础设施中,进一步扩大 NVIDIA 在 AI 计算领域的影响力。

市场影响

NVIDIA 对高性能互连和弹性的关注与其在 AI 硬件市场的主导地位保持一致,截至 2026 年 9 月 15 日,公司市值达 5.15 万亿美元。通过 NVLink 6,NVIDIA 不仅巩固了其在 GPU 技术方面的领导地位,还将自身定位为下一代 AI 应用(从生成模型到自主代理)的关键推动者。

对于投资者而言,NVIDIA 在 AI 基础设施领域的技术进步表明其具有持续增长的潜力,尤其是在超大规模企业和企业扩展 AI 部署的情况下。NVLink Fusion 的推出将 NVLink 6 的能力扩展到定制 XPU,这可能进一步巩固 NVIDIA 的生态系统主导地位,确保其硬件继续成为 AI 创新的核心支柱。

了解更多关于 NVLink 6 及其在 Rubin 平台中的集成信息,请访问 NVIDIA 的官方网站。


Read More