Copied


NVIDIA 发布 Nemotron 3.5 Lightning NVFP4 提升 AI 效率

realtime news   Aug 17, 2026 18:54 1 Min Read


NVIDIA 推出了 Nemotron 3.5 Lightning NVFP4,这是其 Nemotron 系列大型语言模型的一个先进检查点,旨在优化吞吐量的同时保持精度。通过利用 NVIDIA 专有的 NVFP4(4 位浮点)格式和量化感知蒸馏(QAD),该模型的推理速度相比全精度版本提高了多达 4 倍,同时将内存使用量从 FP16 格式的 66GB 减少到仅 22GB。

这一发布反映了 NVIDIA 对低精度推理在成本敏感和高吞吐量环境中使用的关注。Nemotron 3.5 Lightning 是一个拥有 300 亿参数的专家混合(MoE)模型,每个 token 激活 30 亿参数,使其能够处理工具支持的 AI 代理、代码审查和企业级工作流等任务。NVFP4 优化使开发者能够部署响应速度更快、运营成本更低的 AI 系统,这对于边缘计算和始终在线的 AI 应用至关重要。

关键技术进步

量化感知蒸馏(QAD)是 Nemotron 3.5 Lightning NVFP4 效率提升的核心。与通常为压缩而牺牲准确性的标准后训练量化(PTQ)不同,QAD 允许量化模型(“学生”)在训练期间从全精度模型(“教师”)学习。NVIDIA 证明,QAD 能够从激进的量化中显著恢复准确性损失,在测试基准中达到 99.72% 的中位数准确性恢复。

NVIDIA 专有的 4 位浮点精度 NVFP4 格式进一步提升了 Blackwell 时代 GPU(如 DGX B300)的性能。这种激进量化和精度调整的结合,使模型能够在较小的内存占用中运行,而不会影响输出质量。

实际应用

Nemotron 3.5 Lightning NVFP4 专为高性能用例而设计,例如本地化 AI 推理、企业客户支持机器人和实时代码助手。其与 NVIDIA 的模型优化器兼容,为开发者提供了一套从训练、量化到使用 Nemotron 架构部署自有模型的端到端流程。NVFP4 检查点在 Hugging Face 上的公共可用性确保了 AI 研究人员和企业团队的可访问性。

该模型的内存需求减少和吞吐量提升,使其对在受限硬件上部署 AI 或旨在降低云推理成本的企业特别具有吸引力。例如,据报道,NVFP4 检查点可高效运行在 DGX Spark 或 GB10 级别配置上,为本地和服务器环境提供灵活性。

这对 AI 开发的意义

NVIDIA 在低精度模型优化方面的努力标志着 AI 的一个更广泛趋势:从追求模型规模转向注重操作效率。通过在不显著牺牲准确性的情况下实现激进量化,Nemotron 3.5 Lightning NVFP4 降低了部署大型语言模型的门槛。

对于开发者来说,NVIDIA 的 QAD 流程提供了一种可复制的方案,用于在不牺牲质量的前提下降低 AI 部署成本。完整的训练和量化方法可在 NVIDIA 的模型优化器库中找到,这使得将这些技术应用于其他模型变得更加容易。

随着 AI 在各个行业的应用不断增长,类似 Nemotron 3.5 Lightning NVFP4 的工具重新定义了组织如何在计算需求与性能之间取得平衡。其发布可能会促使竞争对手加速低精度推理领域的创新,并提高 AI 驱动解决方案的可访问性。

Nemotron 3.5 Lightning NVFP4 检查点现已在 Hugging Face 上发布,供开发者探索。


Read More