Copied


NVIDIA 推动机器人技术边界:Cosmos 3 与 WAMs

realtime news   Aug 04, 2026 16:49 1 Min Read


NVIDIA 正在通过其 Cosmos 3 平台重塑机器人领域,这是一种为世界动作模型 (WAMs) 设计的基础模型。WAMs 代表了机器人技术的尖端转变,结合了物理世界建模和动作预测,使机器人能够适应并在动态环境中运行。这标志着从传统的视觉-语言-动作 (VLA) 模型的转变,后者在语义理解方面表现出色,但在物理泛化方面往往表现不足。

与将观察结果和指令映射到动作的 VLA 不同,WAMs 建立在基于视频的世界模型之上,能够预测物理场景如何演变。这种方法赋予机器人预测结果的能力,例如物体如何移动或交互,使其变得更加多功能。NVIDIA 的 Cosmos 3 作为一个开放基础于 2026 年推出,为这一转变提供了支柱。

是什么让 Cosmos 3 与众不同?

Cosmos 3 基于 NVIDIA 的 Mixture-of-Transformers (MoT) 架构,实现了视频、文本、音频和动作的多模态学习。凭借 3.48 亿个视频和 800 万个动作样本组成的大规模训练数据集,Cosmos 3 提供了对真实世界动态的基于物理驱动的理解。该模型有三种配置——Edge (4B 参数)、Nano (16B) 和 Super (64B),适用于设备端和工作站部署。

对于机器人开发者来说,Cosmos 3 提供了实际的优势。它减少了训练机器人所需的任务特定数据量,提高了对未知环境的泛化能力,并加速了对新机器人平台(例如不同的机械臂或抓手)的适应性。一项最近的研究表明,基于 Cosmos 3 的全能模型架构训练的策略比传统方法表现更好,在 RoboLab 基准测试中的任务成功率从 28.1% 提高到 36.8%。

为什么 WAMs 正在受到关注

世界动作模型在机器人和人工智能社区中迅速受到关注。与高度依赖预定义演示的 VLA 不同,WAMs 利用通用物理原理。这使得数据收集更便宜、更高效,因为任何交互数据——例如物体被推动、抓取或掉落——都可以成为有价值的训练材料。

此外,WAMs 在仅有语义理解不足的开放世界场景中表现出色。例如,配备 WAM 的机器人可以预测毛巾如何折叠或液体如何倾倒,即使在训练期间未遇到过的情况下。这种适应能力对于实际应用至关重要,从自主制造到家庭辅助。

部署与可访问性

NVIDIA 已通过 Hugging Face 和 GitHub 等平台广泛提供 Cosmos 3。开发者可以使用自己的数据集对 WAMs 进行后续训练,并在各种硬件配置中部署。例如,Edge 模型可以在 NVIDIA Jetson 模块上运行实时机器人控制任务,而 Nano 模型支持 RTX GPU 上的更高计算负载。

通过以宽松的商业使用许可发布 Cosmos 3,NVIDIA 正在鼓励广泛采用和创新。即将举行的活动,例如 8 月 13 日的 Cosmos Labs 直播,将进一步与社区互动并展示该平台的能力。

展望未来

WAMs 代表了机器人技术的范式转变,从模仿人类演示转向理解和预测物理动态。NVIDIA 的 Cosmos 3 处于这一演变的前沿,为构建适应性强、高效的机器人策略提供了坚实的基础。对于开发者和研究人员来说,尝试 Cosmos 3 的机会可能会解锁具身人工智能的新可能性。

借助开放工具、最先进的模型和不断增长的生态系统,WAMs 有望重新定义机器人在现实世界中的能力。


Read More