Copied


NVIDIA 推出的 Spectrum-X 以太网重新定义 AI 网络

realtime news   Aug 24, 2026 16:36 1 Min Read


NVIDIA 推出了其 Spectrum-X 以太网平台,这是一项专为超大规模 AI 工作负载设计的革命性网络解决方案。传统的以太网虽然适用于通用数据中心流量,但在面临 AI 训练所需的同步高带宽需求时却显得力不从心。Spectrum-X 通过硬件和软件的共同设计,克服了这些瓶颈,为基于 GPU 的 AI 工厂提供了低延迟、高利用率和高可靠性的性能。

随着生成式 AI 的加速普及,形势变得愈发紧迫。分布式模型训练现在涉及数十万 GPU,产生了低熵、同步的流量模式,这些模式往往会压垮传统的以太网。NVIDIA 的 Spectrum-X 承诺提供高达 1.6 倍的 AI 网络性能提升,对于那些希望扩大 AI 基础设施的组织来说,这是一项至关重要的技术。

传统以太网为何无法满足需求

传统以太网网络是为高熵、以 Web 为中心的流量设计的,却难以应对 AI 的特定需求。GPU 集群依赖于诸如 All-Reduce 和 All-Gather 等同步操作,这暴露了三大主要限制:

  • 哈希碰撞:像等价多路径(ECMP)这样的静态路由可能导致负载分布不均,GPU 在等待延迟数据时处于闲置状态。
  • 数据包丢失:高拥堵会触发重传,干扰 AI 训练周期。
  • 慢速拥堵控制:现有协议无法快速适应同步 AI 流量突发,导致延迟激增和带宽利用率不足。

这些低效率在多租户环境中尤为关键。例如,NVIDIA 的测试表明,当引入背景流量时,标准以太网上的训练时间会减慢 1.6 倍。Spectrum-X 通过高级隔离和拥堵管理技术解决了这一问题。

Spectrum-X 的关键创新

与现成的以太网不同,Spectrum-X 集成了硬件加速的自适应路由、拥堵控制和负载均衡,这些都是专为 AI 工作负载设计的。其创新包括:

  • 自适应路由: Spectrum-X 交换机可在微秒内动态地将数据包引导到最不拥堵的路径上,快速响应流量不平衡。
  • 针对性拥堵控制: 基于硬件的系统确保快速、精确的速率调整,而不会对短期突发流量反应过度。
  • 多平面技术: 网络被划分为多个独立的平面,实现了巨大的可扩展性,同时不会增加延迟或抖动。

在一次测试中,Spectrum-X 在重度拥堵下保持了稳定的训练性能,而传统以太网的步长时间则膨胀了 1.6 倍。此外,其硬件加速的故障切换系统在 2.68 毫秒内即可从链路故障中恢复,而基于软件的解决方案则需要超过一秒钟。

市场影响

此次发布正值 AI 驱动行业迅速扩展其基础设施之际。NVIDIA 作为 GPU 技术的领导者,正将 Spectrum-X 定位为下一代 AI 工厂的骨干网络。其减少 “AI 完成时间”(完成 AI 训练任务所需的时间)的能力,可能使其成为企业在大型语言模型和其他高强度 AI 工作负载中不可或缺的工具。

对于投资者而言,NVIDIA 从 GPU 到网络的端到端 AI 解决方案的关注,进一步巩固了其在 AI 硬件市场的主导地位。截至 2026 年 8 月 24 日,NVIDIA 的市值为 5.13 万亿美元,其股价为 210.19 美元,过去 24 小时内下跌了 2.11%。然而,鉴于对 AI 基础设施需求的增长,其长期前景仍然强劲。

展望未来

Spectrum-X 以太网不仅仅是一次性能升级——它是一种专为 AI 工作负载独特需求设计的架构转变。在各组织竞相部署超大规模 AI 的背景下,NVIDIA 的专业网络平台可能成为一项核心技术。计划扩展 AI 能力的企业应密切关注未来几个月 Spectrum-X 在实际部署中的表现。


Read More