NVIDIA Groq 3 LPX 在 Vera Rubin 上达到 3,431 TPS 基准
NVIDIA 的 Groq 3 LPX 在 AI 推理性能标准上进行了重新定义,根据 2026 年 8 月 24 日的一篇官方博客文章,在 100K 上下文基准中达到了世界级的每秒 3,431 个令牌(TPS)。由 Artificial Analysis 使用 Gemma 4 31B 模型进行基准测试,这一性能突显了 Groq 3 LPX 在 NVIDIA 的先进 Vera Rubin 平台上处理高交互性和长上下文 AI 工作负载的能力。
Groq 3 LPX 基于 NVIDIA 的 LP30 加速器和机架级架构,提供 315 PFLOPS 的 FP8 推理计算能力和 128 GB 的 SRAM。系统专注于确定性执行、低延迟令牌生成和精细化调度,使其能够在多回合代理会话和上下文随着用户交互显著增长的交互性工作负载中表现出色。相比之下,传统模型通常难以在如此规模的上下文下保持交互性,尤其是处理长输入上下文时。
Artificial Analysis 使用 100K 输入上下文长度运行了基准测试,测量了 Groq 3 LPX 以前所未有的速度生成输出的能力。这对于诸如编码或推理工作流等代理型 AI 任务尤为重要,这些任务需要处理大量累积的上下文。NVIDIA 报告称,这种速度可以在 1.5 秒内生成 5,000 个令牌,而在 100 TPS 时需要 50 秒——效率提升了一个数量级。
值得注意的是,该系统在 10K 上下文基准测试中也表现出色,以 3,382 TPS 的速度运行,并且延迟变化极小。在编码任务中,NVIDIA 的 SPEED-Bench 测试显示中位速度为每秒 4,767 个输出令牌,其中 20% 的任务超过了 5,500 TPS,这突显了 LPX 在不同用例中的多功能性。
对 AI 工厂和工作负载的影响
Groq 3 LPX 被定位为 NVIDIA Vera Rubin 平台中的关键组件,特别是在高交互性服务层至关重要的 AI 工厂中。其在管理超过 100K 上下文令牌时保持低延迟的能力可能会改变依赖复杂多回合 AI 交互的行业,例如客户服务自动化、大规模编码助手和实时决策系统。
实现这一能力的关键在于 LPX 的编译器调度工作负载规划,它最大限度地减少了其 256 个互连 LPU 之间的通信开销。通过在细粒度级别上重叠计算和通信,该系统即使在传统张量并行技术通常失效的小批量尺寸下也能实现无与伦比的效率。
NVIDIA 的战略定位
这一公告发表在 NVIDIA 巩固其在 AI 硬件领域领导地位的关键时刻。尽管 Groq 3 LPX 并非独立的加密货币相关产品,但其对 AI 驱动行业的影响巨大。通过 Groq 3 LPX 增强的 NVIDIA Vera Rubin 平台,使公司能够在从实时推理到生成式 AI 应用的高需求 AI 工作负载中占据主导地位。
NVIDIA (NVDA) 的股票最近交易价格为 210.18 美元,在过去 24 小时内下跌 2.11%,这与更广泛的市场疲软有关。然而,公司在 AI 推理技术方面的进步强化了其长期增长叙事,尤其是在高利润率的企业解决方案中。最近关于中国特定 LPU 产品的传闻被 NVIDIA 否认,明确表示不存在这样的路线图,这可能会缓解投资者的地缘政治担忧。
接下来是什么?
Groq 3 LPX 展现的性能为需要速度和规模的新 AI 应用打开了大门。NVIDIA 暗示即使在数十万令牌上下文中也能保持这些速度,这可能进一步革新代理型 AI 用例。鉴于其强大的性能指标以及与 Vera Rubin 的战略整合,Groq 3 LPX 可能在未来几年为高交互性 AI 系统设定基准。