NVIDIA Groq 3 LPX通过确定性执行提升AI效率
NVIDIA的Groq 3 LPX加速器技术正在AI效率方面树立新的标杆,它利用确定性执行优化功耗,同时处理高交互性推理工作负载。该技术宣布将在2026年下半年集成到NVIDIA Vera Rubin平台中。与以前一代系统相比,当处理超过两万亿参数的大型AI模型时,Groq 3 LPX每兆瓦吞吐量提升高达35倍。
这一进步的核心是Groq 3 LPX的确定性执行模型。与依赖于缓存和分支预测器等反应性硬件机制的传统加速器不同,Groq 3 LPX通过逐周期调度每个计算和数据移动,确保了性能的可预测性。这种方法不仅实现了超快的交互性,还实现了精准的电源管理,解决了AI工厂中的一个关键瓶颈:能效。
功率效率:边际博弈
AI工厂受到功率预算的限制,使每瓦性能成为成功的终极衡量标准。Groq 3 LPX集成了预置电源(Preemptive Power, PEP)和时钟周期合成(Clock Period Synthesis, CPS)等技术,这些技术协同工作显著减少了电压下跌——由需求陡增导致的电力供应短暂下降。通过主动准备电力交付网络并平滑电流需求,这些技术降低了“电压保护带”(通常为稳定运行而需要的额外功率余量)。
内部测试显示,Groq 3 LPX将电压下跌减少了60%以上,从而使基准电压需求降低了高单位数百分比。由于功耗与电压的平方成比例,这意味着在不牺牲性能的情况下实现了潜在的两位数百分比功耗节省。对于AI工厂来说,这意味着在相同的能量预算内可以生成更多的token,从而提高了运营效率。
集成到NVIDIA Vera Rubin平台
Vera Rubin平台是NVIDIA的旗舰AI计算系统,专为大规模功率效率而设计。它结合了机架级创新技术如智能电力平滑(Intelligent Power Smoothing)与工厂级工具如NVIDIA DSX MaxLPS,这些工具根据工作负载需求动态重新分配机架间的功率。这些功能使运营商能够在相同的功率范围内配置多达40%的额外GPU,同时提供35%更高的token吞吐量。
通过加入Groq 3 LPX,NVIDIA正在解决高交互性AI工作负载的关键挑战:延迟。确定性执行模型确保了可预测的低延迟token生成,补充了以吞吐量优化的Vera Rubin NVL72。结合起来,这些技术构建了一个能够将AI推理扩展到新高度的综合系统。
监管与市场背景
虽然NVIDIA基于Groq的技术进步在技术上令人印象深刻,但其与Groq的合作协议引起了监管机构的关注。美国司法部据报道正在调查这一安排,而NVIDIA公开否认计划为中国市场开发特定版本的基于Groq的LPU。这些发展可能会影响该技术在关键市场的推广。
尽管面临这些障碍,NVIDIA的市场地位依然强劲。截至2026年9月15日,其股票交易价格为$212.07,市值达到5.15万亿美元。随着AI工作负载推动对计算效率的爆炸性需求,Groq 3 LPX和Vera Rubin平台使NVIDIA有望抓住这一趋势。
展望未来
NVIDIA的Groq 3 LPX加速器计划于2026年晚些时候在Vera Rubin平台上投入使用。随着AI工厂不断挑战功率和性能的极限,确定性执行的采用可能成为高效能、低延迟AI推理的行业标准。投资者和行业利益相关者将密切关注NVIDIA如何应对未来数月的监管挑战和竞争压力。