NVIDIA Groq 3 LPX 实现全面生产,助力 Agentic AI
NVIDIA 于 8 月 24 日宣布,其 Groq 3 LPX 推理加速器现已全面投产,这是支持新一代 Agentic AI 系统的重要一步。Groq 3 LPX 专为配合 NVIDIA 的 Vera Rubin NVL72 AI 平台而设计,提供业界领先的 token 生成速度——这一点对于需要实时响应的应用至关重要。
在使用 Gemma 4 31B(一种开源的 Agentic AI 模型)进行的基准测试中,Groq 3 LPX 在长上下文用例中每秒生成 3,400 个输出 token,比竞争平台提高了四倍。此性能使 NVIDIA 能够应对 AI 行业从模型训练向大规模推理和多代理系统转变时对更快推理能力的需求。
AI 工厂需求驱动基础设施演进
Agentic AI 系统正在重塑 AI 市场,这些系统需要广泛的上下文窗口、高 token 吞吐量和低延迟以实现实时决策。NVIDIA 的 Vera Rubin NVL72 平台将 CPU、GPU 和 NVLink 网络集成到一个统一的系统中,为这些工作负载提供了可扩展的解决方案。通过降低 token 成本并提高效率,该平台旨在满足超大规模 AI 工厂、企业部署和云服务提供商的需求。
CoreWeave 和 Nebius 是 Vera Rubin NVL72 系统和 Groq 3 LPX 加速器的早期采用者。CoreWeave 部署了 NVIDIA 的 Spectrum-X Multiplane 网络技术,以增强 AI 工厂组件之间的带宽和连接性,而 Nebius 则将该平台集成到其 AI 云中,强调了其在高需求环境中的潜力。
SpaceXAI 成为重要合作伙伴
SpaceXAI 宣布将部署 NVIDIA Vera CPU 作为其下一代 AI 架构的一部分,将公司的能力从基于地球的数据中心扩展到轨道卫星。这一合作强调了 NVIDIA 将其硬件和软件组合与多样化、高风险应用(从自治代理到仿真)相结合的战略。
Agentic AI 的极致协同设计
NVIDIA 强调“极致协同设计”是其方法的基石。这意味着计算、网络和推理加速的每一层都共同开发,作为一个协同的整体运作。Groq 3 LPX 针对 Agentic 系统中逐 token 生成响应的解码延迟这一瓶颈进行了优化。通过将低延迟 LPX 加速器与 Rubin GPU 的重上下文处理相结合,该架构消除了速度与吞吐量之间的传统权衡。
这种全栈优化在 AI 推理成为竞争差异化因素的背景下尤为重要。推理现在占大型 AI 部署成本的主要部分,因此提高效率的进展至关重要。NVIDIA 的系统旨在最大化基础设施利用率,同时将每 token 成本降到最低——这是企业和云服务提供商密切关注的一个指标。
市场和行业影响
NVIDIA 的进步正值整个 AI 行业快速扩张之际。该公司对 Agentic AI 的关注与市场需求保持一致,因为企业越来越多地采用需要可扩展、实时推理能力的模型。
在股票交易方面,截至 8 月 24 日,NVIDIA 的股价为 210.31 美元,过去 24 小时内下跌 2.05%。尽管有这一小幅下跌,该公司 5.13 万亿美元的市值反映了投资者对其 AI 驱动增长战略的强烈信心。随着 Groq 3 LPX 的推出及其在 Vera Rubin NVL72 中的集成,随着采用率的增长,这可能会成为进一步市场活动的催化剂。
未来展望
NVIDIA 本周正在帕洛阿尔托举办的 Hot Chips 会议上展示其最新创新,包括 Spectrum-X Multiplane 网络和 NVLink Fusion。这些技术旨在进一步扩展 AI 工厂,同时保持效率和性能。随着 Agentic AI 时代刚刚开始,NVIDIA 在基础设施优化和极致协同设计方面的投资使其在这一高增长领域中占据了领先地位。