NVIDIA NIM 将 Nemotron 3 Ultra 吞吐量提升至 2.5 倍
NVIDIA 发布了其 AI 推理微服务的重大升级,声称其 NIM 2.0.12 优化堆栈在 Nemotron 3 Ultra 系统上实现了 2.5 倍的吞吐量提升。这一改进使企业能够在不牺牲延迟的情况下,在相同的 GPU 基础设施上服务更多的并发用户。
这一优化在 2026 年 9 月 10 日发布的技术博客中进行了详细介绍,重点关注自主 AI 工作负载——这些应用需要扩展的上下文重用和高交互性。通过使用 NVIDIA 的 NIM(NVIDIA 推理微服务),其包含模型和 GPU 感知的服务配置,开发者可以部署经过验证配置的 AI 应用,达到生产级性能目标。
关键性能提升
Nemotron 3 Ultra 系统在运行四块 NVIDIA B200 GPU 时的基准测试突出了 NIM 优化的影响:
- 未启用 NIM 时的基线吞吐量:718 个 token/秒 (tok/s)。
- NIM 2.0.12 优化堆栈:1,997 个 token/秒,提升 2.5 倍。
这一性能提升是通过精度调优、并行执行、内存优化和推测解码策略的组合实现的。例如,MTP(专家模型张量并行)推测解码在维持低延迟目标的同时提高了 token 生成速度,这对聊天界面和 AI 助手等应用至关重要。
对企业的影响
增强的吞吐量直接转化为更高的可扩展性,使企业能够在每位用户每秒 50 次事务 (TPS) 的情况下服务多达 2.5 倍的用户。这在生成式 AI 应用需求不断增长的背景下尤为重要,企业正在客户服务、内容生成和高级分析中部署解决方案。
通过集成这些预包装的推理服务,公司可以降低部署复杂性并降低运营成本。NVIDIA 还通过其 AI Enterprise 套件提供商业支持和硬件验证,确保生产环境的可靠性。
如何基准测试 NIM
NVIDIA 鼓励开发者使用其专有的基准测试工具 AIPerf 测试 NIM 在其工作负载上的性能。通过重放代表性流量,企业可以确定针对其延迟和吞吐量需求优化的配置。公司强调,虽然已发布的基准测试提供了一个强有力的起点,但实际性能将根据工作负载的具体情况有所不同。
市场背景
NVIDIA 对全栈优化的推动与其主导 AI 基础设施市场的更广泛战略一致。截至 2026 年 9 月,NVIDIA 的市值达到 5.299 万亿美元,凸显了其在 AI 硬件和软件解决方案中的领导地位。最近的举措,如与 Coherent 达成的 20 亿美元合作以升级其 AI 基础设施,进一步巩固了其地位。
这一公告发布之际,企业愈发重视可扩展、成本高效的 AI 部署。随着今年早些时候宣布的新液冷创新以降低数据中心能源成本,NVIDIA 同时解决了性能和可持续性问题——这种双重关注与企业买家的需求不谋而合。
展望未来
对于希望利用这些进步的开发者和企业来说,Nemotron 3 Ultra 的 NIM 2.0.12 现已可供下载。NVIDIA 计划扩展其性能优化配置库以覆盖更多模型,为多样化的用例提供更量身定制的解决方案。
在性能和可扩展性至关重要以保持竞争力的市场中,NVIDIA 的 NIM 2.0.12 使公司及其客户在部署生产就绪的 AI 系统方面领先一步。