Copied


NVIDIA 优化 AI 注意力机制以提升长上下文推理性能

realtime news   Jul 31, 2026 22:53 1 Min Read


NVIDIA 发布了一个新的框架,用于优化 AI 模型中的注意力机制,旨在提升长上下文推理中的性能。随着工作负载中的上下文长度达到前所未有的高度——涵盖数万标记,这些进展对于解决传统注意力方法的计算瓶颈至关重要。

该公司的方法为开发人员详细阐述了四项关键设计原则,以最大限度地提高 GPU 利用率和推理吞吐量。这些指南解决了处理密集注意力时的低效问题,其中每个标记都必须与序列中的所有其他标记相互作用。一个值得注意的发现是:在 NVIDIA 的 DeepSeek-R1 基准测试中,注意力的计算成本现在占推理时间的主导地位,从 4,000 标记时的 18% 上升到 128,000 标记时的 85%。

高效模型设计的指南

NVIDIA 的建议集中在四个领域:

  • 分组大小 (G): 建议开发人员在解码任务中增加查询到键值 (KV) 映射的分组大小。并行处理输入序列的预填充任务对此参数的敏感性较低。强调使用分组查询注意力 (GQA) 模型,即多个查询头共享一个 KV 头,以减少内存流量并提高 GPU 利用率。
  • 头维度 (Hsz): 最优的头维度为 128 或 256,这与 GPU 瓦片大小和内存传输效率一致。较小的维度难以充分利用硬件,而较大的维度可能会超出内存容量。
  • 序列长度: 预填充任务的扩展与序列长度呈二次方关系,而解码任务的扩展与 KV 缓存大小呈线性关系。NVIDIA 强调了 KV 缓存压缩和混合模型架构等技术,以降低长序列相关的成本。
  • 并行化策略: 仅当 KV 头数量 (KH) 足够时,推荐使用张量并行 (TP),即在 GPU 之间分割注意力头。对于 KV 头数量较少的模型,替代方法如注意力数据并行 (ADP) 或 KV 并行 (KVP) 更为适合。

应对竞争激烈的市场

长上下文能力已成为 AI 竞赛中的关键差异化因素,特别是在企业应用领域。最近的突破,例如稀疏注意力技术将推理成本降低 40%(于 2026 年 6 月宣布),加速了竞争。据 NVIDIA 称,其 FlashAttention 内核通过在 GPU 上流式处理更小的数据瓦片,减少了内存访问开销,从而进一步提高了性能。

这一优化方向与长上下文模型在法律分析、视频转录和企业知识查询等领域的日益增长的应用场景相符。据报道,主要 AI 实验室正在将模型扩展到 100 万标记以上(本月早些时候已宣布),这凸显了 NVIDIA 的创新在支持这些进步中的重要性。

展望未来

NVIDIA 专注于通过注意力特定优化共同设计 AI 模型,反映了硬件与软件协同发展的更广泛趋势。稀疏注意力技术(作为此次发布的后续内容提及)预计将进一步扩展长上下文推理的能力。随着企业对大规模数据集的实时交互需求日益增长,这些发展可能重新定义 AI 领域的效率基准。


Read More