Copied


NVIDIA Nemotron 3.5 Lightning 提升 AI 代理效率

realtime news   Aug 11, 2026 13:39 1 Min Read


NVIDIA 推出了 Nemotron 3.5 Lightning,这是一款 30B 专家混合(MoE)模型,专为高容量、低延迟的始终在线 AI 代理任务优化设计。作为 Nemotron 系列的最新成员,该模型专注于执行密集型工作负载,例如工具调用、输出验证和子代理分配,以更低的计算成本提供更快的吞吐量。该模型完全开源,其权重和训练配方以宽松许可的方式提供。

Nemotron 3.5 Lightning 采用精简化的设计,每次推理步骤仅使用 30 亿个激活参数。这使其能够在不牺牲复杂任务所需容量的情况下,提供小型模型的计算效率。该模型特别针对构建多模型系统的开发人员,其中前沿模型(如 Nemotron 3 Ultra)负责编排,而较小的模型(如 Lightning)处理重复的资源密集型任务。

Nemotron 3.5 Lightning 的关键创新

Nemotron 3.5 Lightning 利用了多种最前沿技术来实现性能提升:

  • 投机解码:预训练中引入了多标记预测(MTP),在不影响准确性的情况下提高速度,并通过 NVIDIA 的 DSpark 和 DFlash 草稿模型支持推理优化。
  • 量化:该模型支持 NVFP4 精度,可高效部署在从桌面级 NVIDIA DGX Spark 系统到大型数据中心的 GPU 上。
  • 针对框架优化的训练:专为 OpenClaw 和 Hermes Agent 等流行代理框架量身打造,模型在高调用量场景下减少延迟并提高准确性。

凭借这些特性,Nemotron 3.5 Lightning 在其类别中引领了准确性-速度的帕累托前沿。据 NVIDIA 称,与 Qwen3.6 35B 等类似模型相比,它在完成 10,000 个代理任务时速度快了 30%,同时保持了相似的准确性。

对 AI 工作流程的广泛影响

该模型无缝集成到 NVIDIA 的开源 AI 生态系统中,包括新的 NeMo Switchyard 库,该库可智能地将任务路由到最有效的模型。这种任务分工使前沿模型专注于规划和推理,而执行模型如 Lightning 处理标记密集型的繁重工作。

Nemotron 3.5 Lightning 的开放特性也使其非常适合定制化应用。开发人员可以通过轻量级技术(如 LoRA)对其进行微调,或使用 NVIDIA 的 NeMo RL 和 Gym 工具包进行强化学习。这种灵活性确保了模型能够适应多种应用场景,从 NVIDIA GeForce RTX 5090 GPU 上的本地 AI 系统到企业级部署。

市场背景与行业影响

Nemotron 3.5 Lightning 的发布正值 NVIDIA 继续在 AI 硬件和软件市场占据主导地位之际,截至 2026 年 8 月 11 日,其市值已达到 5.3 万亿美元。通过 Nemotron 系列,NVIDIA 正在巩固其在快速增长的代理 AI 领域的地位,该市场细分专注于能够执行复杂、多步骤任务的自主系统。

此次发布建立在早期 Nemotron 模型的成功基础上,包括 2026 年 3 月推出的 Nemotron 3 Ultra,后者专注于推理任务的更高吞吐量。通过针对高容量执行任务,Nemotron 3.5 Lightning 补充了这些早期模型,为构建多代理系统的开发人员提供了更完整的工具集。

展望未来

NVIDIA 鼓励开发人员通过 Hugging Face 和公司自己的 Build.NVIDIA.com 平台探索 Nemotron 3.5 Lightning。凭借对效率和可访问性的关注,这款模型有望成为构建下一代 AI 系统的关键资产。

随着 AI 领域竞争的加剧,NVIDIA 对开放、可定制模型(如 Nemotron 3.5 Lightning)的重视可能为 AI 工具的开发和部署树立新的标准。


Read More