NVIDIA TensorRT 多设备推理提升 AI 效率
NVIDIA 在其 TensorRT 11.0 版本中引入了一项新功能,使生成式 AI 模型能够同时利用多个 GPU,从而应对这些复杂系统日益增长的计算和内存需求。通过利用 NVIDIA 的 NCCL(NVIDIA 集体通信库)进行 GPU 间通信,TensorRT 多设备推理显著降低了高性能 AI 工作负载的延迟,同时保留了 TensorRT 推理引擎的优化。
从实际应用来看,这意味着部署 Cosmos 3 Nano 等模型进行视频生成的组织现在可以在多达八个 GPU 上处理大规模工作负载,根据 NVIDIA 的基准测试,将单个 GPU 的处理时间从超过 156 秒减少到仅 34 秒。这相当于 78% 的端到端延迟降低,变压器 RPC(远程过程调用)的加速比高达 6.09 倍。此改进对于实时媒体生成和迭代设计工作流等对延迟敏感的应用尤为重要,因为更快的结果可以显著提高生产力。
如何运作
TensorRT 的多设备推理使用了一种称为“上下文并行”的分布式处理方法。例如,在 Cosmos 3 Nano 模型中,44,160 个视频标记被分配到多个 GPU,每个 GPU 处理数据的不同子集。系统动态平衡工作负载,确保即使在具有变压器层和高内存需求的复杂模型中也能将瓶颈降至最低。
NVIDIA Dynamo-Triton(前称 Triton 推理服务器)通过在单一模型服务端点下管理多设备执行来促进这一技术的实现。开发人员不再需要协调各个 GPU 操作;相反,一个 gRPC 调用即可触发分布式 TensorRT 执行。这简化了部署,同时保持了传统的应用程序接口,使团队更容易在不彻底改造现有 AI 流水线的情况下集成多 GPU 加速。
性能基准测试
在 NVIDIA 的测试中,Cosmos 3 Nano 模型在四种配置下进行了基准测试:单 GPU (SD)、双 GPU (CP2)、四 GPU (CP4) 和八 GPU (CP8)。结果显示了显著的扩展性:
- 单 GPU (SD): 156.595 秒端到端延迟
- CP2(2 个 GPU): 87.999 秒(加速 1.78 倍)
- CP4(4 个 GPU): 53.093 秒(加速 2.95 倍)
- CP8(8 个 GPU): 34.183 秒(加速 4.58 倍)
虽然由于 GPU 间通信开销,效率提升并非完全线性,但结果表明模型推理速度得到了显著加速。例如,变压器 RPC 时间从单个 GPU 的 146.192 秒减少到八个 GPU 的 23.993 秒。
市场背景
这一发展正值 NVIDIA 继续主导生成式 AI 硬件市场之际,其 GPU 是大多数大规模 AI 部署的基础。截至 2026 年 9 月,NVIDIA 的市值达到 5.522 万亿美元,其股价在过去 24 小时内上涨了 2.28%,反映了投资者对其 AI 创新的持续信心。
为 TensorRT 11.0 增加对多设备推理的全面支持,与 NVIDIA 的整体战略一致,即实现可扩展的 AI 基础设施。最近的更新,例如 TensorRT OSS 11.2 和 TensorRT Model Connect 的引入,进一步巩固了 NVIDIA 在优化大型 AI 模型的训练和推理方面的领导地位。
下一步是什么?
对于优先考虑速度而非最小硬件使用的组织来说,TensorRT 的多设备推理提供了一个有吸引力的权衡。然而,NVIDIA 提醒团队在确定部署策略时应考虑生成输出的成本、总拥有成本 (TCO) 和并发请求吞吐量等指标。随着像 Dynamo-Triton 26.07 这样的工具现已可用,开发人员可以开始测试和部署多 GPU 设置以优化其 AI 工作流。
有关更多资源,NVIDIA 提供了关于 Dynamo-Triton、TensorRT 和 Torch-TensorRT 的文档和指南,以及 Cosmos 3 Nano 等示例模型,以帮助团队入门。