Copied


NVIDIA推出Topograph用于拓扑感知的GPU调度

realtime news   Sep 22, 2026 18:35 1 Min Read


NVIDIA发布了Topograph,这是一款开源工具包,旨在通过利用拓扑感知调度优化AI工厂中的GPU工作负载分配。这个新解决方案解决了因资源分配碎片化导致的效率低下问题,这些问题可能会限制GPU吞吐量并增加AI训练和推理工作负载的运营成本。

Topograph的核心功能是绘制GPU、NVLink和InfiniBand等网络结构以及其他集群组件之间的物理和逻辑连接。这使得像Kubernetes、Slurm和Slinky这样的调度器可以通过将紧密耦合的任务分配到具有更优互连性能的GPU上来做出更智能的分配决策。NVIDIA表示,这种方法可以减少延迟、最小化跨较慢链路的GPU间流量,并通过确保GPU减少因数据等待而闲置的时间来提高成本效率。

为何这对AI工作负载至关重要

随着AI工作负载变得更加复杂和分布式,拓扑感知调度已经成为关键焦点。大规模训练和推理任务通常需要在GPU之间进行大量数据交换。如果没有拓扑感知,这些工作负载可能会分布在距离较远或连接较差的GPU之间,从而导致网络拥堵、更高的延迟以及加速器资源未充分利用。

通过整合Topograph,调度器可以基于实时拓扑数据优化分配。例如,通过NVIDIA NVLink或NVSwitch连接的GPU——在最新一代中提供高达3.6 TB/s的带宽——可以优先用于紧密耦合的任务,而对连接要求较低的任务可以使用较慢的PCIe路径或以太网结构。

如何运作

Topograph通过云API(例如Google Cloud、OCI)或本地系统(如NVLink和Spectrum-X结构)发现集群拓扑。它将这些数据标准化为通用模型,并以调度器友好的格式导出,例如Kubernetes节点标签、Slurm拓扑配置或Slinky ConfigMaps。

该工具还与NVIDIA的DSX OS集成,结合动态资源分配(DRA)和KAI调度器实现群组调度——确保一个任务中的所有Pod都位于同一拓扑域内。本月早些时候发布的Kubernetes v1.37进一步支持这一点,通过扩展拓扑感知调度功能来处理多层次的工作负载层次结构。

更广泛的影响

Topograph的发布反映了NVIDIA持续推动云端和本地AI基础设施中GPU效率最大化的努力。这正值AI模型训练成本因数据集和模型规模的迅速增加而飙升之际。通过改善网络局部性并减少GPU闲置时间,Topograph可能降低AI工厂的总体拥有成本,从而使高性能计算对中小型企业更加可行。

此外,Topograph与NVIDIA近期对Kubernetes生态系统的其他贡献保持一致,例如捐赠其动态资源分配驱动程序以及其在KAI调度器(一个CNCF Sandbox项目)上的持续工作。这进一步巩固了NVIDIA作为AI基础设施优化领域领导者的地位。

接下来是什么

Topograph作为一个开源项目可在GitHub上获取,并可通过Helm为Kubernetes用户部署,或通过本地包为Slurm集群部署。它支持云端和本地环境,旨在为多样化的部署模型提供统一的调度解决方案。

对于AI开发者和基础设施运营商来说,采用Topograph可能在多节点训练和推理场景中解锁显著的性能提升。随着Kubernetes和其他调度器继续增强拓扑感知功能,像Topograph这样的工具很可能成为在AI竞争中保持领先的关键。


Read More