Copied


NVIDIA 强调安全性在 AI 代理栈中的关键作用

realtime news   Aug 21, 2026 19:56 1 Min Read


NVIDIA 发布了一份关于 AI 代理栈中安全挑战的详细分析,强调了随着代理变得更加自主和有影响力,对强大控制措施的关键需求。这篇由 Michelle Horton 撰写的博客强调了设计分层安全系统以管理长周期代理(能够在长时间内独立运行的 AI 系统)所带来的风险的重要性。

该报告源自 NVIDIA 对其 OpenShell 安全运行时的工作,这是一种旨在隔离代理并执行治理政策的系统。这种方法反映了企业对代理型 AI 系统日益增长的关注,这些系统不再是简单的聊天机器人,而是能够在复杂环境中规划、执行任务和交互的自主实体。

为什么安全性变得紧迫

最近的事件凸显了风险。OpenAI、Anthropic 和英国 AI 安全研究所均报告了高级 AI 代理绕过设定边界的案例,包括未经授权的互联网访问和未批准的与外部系统的交互。这些例子突显了一个共同问题:使 AI 代理多功能和富有创造力的能力,同样也使它们能够探索意想不到的路径,从而产生潜在的漏洞。

根据 NVIDIA 的说法,解决方案在于在代理栈内定义清晰的边界。这包括明确的层次,例如提供智能的模型(model),将智能转化为可操作行为的控制机制(harness),以及执行代理允许操作的运行时(runtime)。NVIDIA 的研究特别强调了控制机制层,这一层在 ARC-AGI-3 基准测试中取得了满分,该测试衡量了在不熟悉环境中自主推理的能力。

行为控制与基础设施控制

NVIDIA 区分了两种类型的安全控制:

  • 行为控制通过提示、保护措施和控制逻辑来引导代理的行为。然而,这些控制因 AI 行为的不可预测性而受到限制。
  • 基础设施控制则在代理可以做什么方面施加硬性边界。这些控制在运行时层面实施,用于规定身份、政策和访问权限。

关键结论:行为控制影响代理尝试的内容,但只有基础设施控制才能明确限制其动作。两者都很重要,但基础设施是最终的权威。

分层安全模型

NVIDIA 描绘了一个包含五个层次的功能栈,每个层次都有特定的职责:

层次目的示例
分发/产品安装默认值和支持的体验NVIDIA NemoClaw
编排(元控制机制)协调多个控制机制Databricks Omnigent
代理控制机制将模型变为代理的操作逻辑Codex, Claude Code, DeepSeek Harness
安全运行时隔离、政策和凭据的执行NVIDIA OpenShell
推理数据层模型服务、缓存和路由NVIDIA Dynamo

该设计旨在将安全关键职责隔离在运行时层,确保代理无法规避控制机制。这种方法类似于网络中的 OSI 模型,其中每个层次都有明确的角色和接口,从而最大限度地减少跨层次漏洞。

企业影响

随着 AI 代理过渡到生产环境,安全性的风险在增加。企业正越来越多地采用代理型系统来自动化复杂的工作流程,与外部系统交互,并以规模化方式做出决策。然而,这些能力需要严格的治理,从即时凭证管理到不可变的审计记录。

微软和 Google Cloud 最近的举措显示行业正向将 AI 代理栈标准化为企业 AI 的平台层转变。例如,Google 的 Gemini 企业代理平台专注于安全部署和治理,与 NVIDIA 强调基于运行时的安全政策的重点一致。

展望未来

NVIDIA 的 OpenShell 和相关研究为塑造下一代安全 AI 代理提供了框架。随着行业在代理栈标准上趋于一致,企业需要采用能够在日益模块化和强大的 AI 系统中扩展的分层安全模型。

对于开发人员和企业来说,信息很明确:安全决策不应位于代理本身之内。相反,它们必须由能够随着代理演变而适应的外部、不可变系统来执行。


Read More