Copied


NVIDIA AVO在ARC-AGI-3基准测试中达成100%表现,重新定义AI代理

realtime news   Aug 21, 2026 21:45 1 Min Read


NVIDIA的Agentic Variation Operators(AVO)研究项目在ARC-AGI-3基准测试中取得了完美的相对人类行动效率(RHAE)得分,达到了100%,完成了25个环境中的全部183个关卡。这一里程碑突显了高级代理系统在应对传统AI模型难以处理的长远任务中的潜力。ARC-AGI-3是一项高度挑战性的交互推理基准测试,要求代理在没有预定义指令或规则的情况下推断目标并适应策略,以应对陌生环境。

AVO的成功标志着自主AI代理开发的重大飞跃。与依赖其内部能力的独立模型不同,AVO集成了持久记忆、监督和反馈驱动的架构,从而支持在长时间任务中的持续进展。NVIDIA将其原本为GPU内核优化设计的AVO系统改编以适应这一多样且复杂的推理基准测试,进一步证明了其多功能性。

ARC-AGI-3:它的独特之处

ARC-AGI-3于2026年3月发布,旨在挑战代理探索未知环境、推断动态并以最少的指导实现目标。该基准测试使用相对人类行动效率(RHAE)指标来评估任务完成情况及其相对于人类基准的效率。当ARC-AGI-3首次亮相时,AI在RHAE上的表现甚至难以达到0.51%,而人类达到了100%。NVIDIA的AVO现在提高了标准,展示了代理设计如何缩小这一差距。

AVO在完成基准测试时使用了Claude Opus 5这一顶级语言模型作为引擎。然而,成功的关键不仅仅是模型本身,而是该代理系统能够复合推理、从反馈中学习并自主调整策略的能力。AVO以比之前最佳系统VISTA少12%的环境行动达成了100%的得分,展现了其效率。

从GPU优化到通用智能

NVIDIA最初开发AVO是为了高性能GPU内核优化,在这一领域,它展现了在长时间内自主解决问题的能力。在一次实验中,AVO连续运行七天,将内核性能优化提高了高达10.5%,超过了FlashAttention-4。这一相同的架构随后被重新用于ARC-AGI-3,突显了其核心设计——以假说测试、持久记忆和迭代反馈为中心——如何跨领域泛化。

虽然GPU优化与交互推理看似无关,但它们共享一个基础性挑战:在庞大且复杂的问题空间中进行试错和自适应学习。NVIDIA的结果表明,AVO的架构可以应用于更广泛的场景,从软件工程到机器人技术及其他领域。

意义何在

ARC-AGI-3的成就不仅是一个技术上的里程碑;它也预示着AI系统评估方式的转变。传统基准测试通常关注孤立的模型性能,而ARC-AGI-3则突出了完整代理系统的重要性——即模型周围的“框架”。持久记忆、恢复机制以及适应真实世界的能力正成为推动AI迈向通用智能的核心。

这也反映了NVIDIA在AI和自主系统领域的更大抱负。他们在AVO上的成功使其成为长远任务代理设计的领导者,这一领域对自动驾驶汽车、工业自动化和自适应AI工具等应用日益重要。

下一步

NVIDIA的AVO研究可能会对行业和学术界产生影响,因为开发者们逐渐超越对单纯模型性能的关注,转而专注于系统级AI设计。在ARC-AGI-3作为一个试验场的背景下,NVIDIA为代理智能的可实现性设定了新的基准。

对于关注NVIDIA的交易员和投资者而言,这一发展进一步强化了该公司在AI领域的技术优势。截至2026年8月21日,NVIDIA的股票交易价格为214.90美元,市值达到5.24万亿美元。尽管AVO成功的直接财务影响可能有限,但它可能会强化NVIDIA在AI研究和企业市场的地位,而这些市场预计将在未来几年内实现显著增长。


Read More