OpenAI 的 Astra 达到关键网络安全门槛,实行严格防护措施
OpenAI 宣布,其新 AI 模型 Astra 成为首个在公司《准备框架》下达到关键网络安全能力门槛的模型。这一里程碑展示了 Astra 能够自主识别和利用强化系统中的零日漏洞,并在无人干预的情况下执行复杂的网络攻击策略。虽然这使 Astra 成为网络安全防御的强大工具,OpenAI 强调了实施严格防护措施以减少误用风险的重要性。
《准备框架》首次于 2023 年发布,并在此后更新,用于评估 AI 模型在包括网络安全等多个高风险领域的表现。被归类为“关键”的模型由于其可能放大进攻性网络行动的潜力,需接受最严格的监管。据 OpenAI 称,Astra 的能力超过了其前身 GPT-5.6 Sol,在 ExploitBench 上取得了完美得分,并在测试中发现了两个此前未知的零日漏洞。这些漏洞已被报告给相关维护者。
鉴于 Astra 的先进能力,OpenAI 推迟了其开发和发布,以加强对网络误用和未授权行为的防护。增强的防护措施包括训练模型拒绝有害请求、实施更严格的监控系统,以及改进防止越狱的防御机制。据报道,Astra 拒绝了 91.5% 的不允许的网络援助请求,较 GPT-5.6 Sol 的 59% 拒绝率有了显著提升。
Astra 最先进的网络安全功能的访问权限最初将受到限制。一个 alpha 测试组将获得早期访问权限,并通过 OpenAI 的 Daybreak Blue 项目支持防御性应用进行更广泛的发布。OpenAI 还承诺在 Astra 发布时,在其系统卡中发布详细的评估和防护措施。
这一发展引发了关于在高级 AI 部署中平衡创新与安全的重要问题。OpenAI 提到,从 2026 年 8 月 Hugging Face 事件中吸取的教训——当时 AI 的误用导致意外泄露——是 Astra 加强防护措施的关键驱动力。公司声称,Astra 的防护措施本可以防止类似事件,再次强调了全面对齐和监控协议的重要性。
OpenAI 对 Astra 的处理反映了随着 AI 模型日益展现执行关键任务能力时,整个行业面临的更广泛挑战。《准备框架》仍然是 OpenAI 治理战略的基石,决定了像 Astra 这样强大的模型如何以及何时推向市场。对于用户来说,这意味着部署过程中可能会更慢并增加摩擦,但也能确保安全始终是 AI 进步的首要考虑。
尽管 Astra 的即刻市场影响尚不明确——尚未透露定价或商业化细节——其首次亮相表明 OpenAI 专注于将先进的 AI 能力与强大的安全措施相结合。随着 AI 模型迈向新前沿,Astra 的发布成为负责任部署可能重新定义网络安全防御和风险管理工具的一次试验案例。