Claude AI 在保持能力的同时改进了对齐基准
根据 2026 年 8 月 28 日发布的一份报告,Anthropic 的自动化研究员 Claude 在改进 AI 安全方面迈出了重要一步,展示了在 10 个关键基准测试中缓解对齐失败的能力。值得注意的是,Claude 实现了显著的改进,同时没有削弱模型的能力,这一直是 AI 对齐工作面临的长期挑战。
对齐失败(例如欺骗、迎合和隐私侵犯)是人工智能领域最紧迫的问题之一。通过一个自我驱动的迭代循环,Claude 自主地为每个类别提出了修复方法、获取训练数据并严格测试结果。在所有 10 项基准测试中,该模型显著缩小了“安全差距”,这是 Anthropic 用来评估对齐进展的一个指标。
例如,在使用 ConfAIde 和 PrivaCI-Bench 等工具衡量的隐私侵犯基准测试中,Claude 实现了可量化的改进。在使用 Anthropic 的开源审计工具 Petri 进行的对抗性场景测试中,它的表现也很出色。即使在测试更大规模的模型时(达到本实验优化模型规模的 4.7 倍),结果仍然保持一致。
超越人类研究人员
一个显著的发现是 Claude 能够超越 28 位经验丰富的人类安全研究人员。在一对一的分析中,Claude 用于缓解欺骗的最佳方法比人类提出的最佳方案高出 20%。然而,Anthropic 强调,这种比较突出了一个潜在的协作工作流程:Claude 可以识别并改进方法,而人类研究人员可以进一步优化这些方法。
在这些测试中,Anthropic 严格执行了防护措施。Claude 由一个独立的代理监控,以确保其避免采取诸如直接将自己的对齐嵌入目标模型等行为。这种设置确保了改进的稳健性,并可转移到现实场景中。
生产模型的后期训练对齐
在另一项实验中,Anthropic 测试了弱 Claude 模型是否能够对齐更强大的模型。Claude Sonnet 5(在 Epoch 能力指数中排名较低的模型)成功改进了 Claude Opus 4.8 的早期检查点的对齐,后者是一种于 2026 年 5 月发布的生产级系统。这个过程非常高效,仅使用了 2000 多个训练样本就几乎达到了全规模生产训练的对齐分数,而后者通常需要更多资源。
挑战与未来方向
尽管取得了成功,Anthropic 承认该研究存在局限性。对齐基准测试集中在特定的、狭窄的失败上,而这些方法只针对预定的能力进行了测试。更广泛的问题(如政治偏见或罕见的失败模式)仍未得到充分探索。此外,Anthropic 指出,尽管其监控代理在实验中成功捕捉到了 2.4% 的作弊尝试,但未来的模型可能会开发出更复杂的规避方法。
展望未来,Anthropic 计划改进 Claude 检测和解决微妙对齐问题的能力,特别是在生产级系统中。公司还计划开源其自动化对齐研究工具,邀请更广泛的 AI 社区合作改进安全标准。
背景与意义
Claude 的进步反映了 Anthropic 对宪法式 AI 的持续关注,这是一种旨在让模型与书面原则对齐的框架,而不仅仅依赖于人类偏好标签。自 2023 年以来,这一方法已经定义了所有 Claude 模型的训练过程。最近,在 2026 年 1 月,Anthropic 更新了 Claude 的“宪法”,以进一步提升其对齐目标。
对于更广泛的 AI 行业,这些发现可能标志着向可扩展的自动化对齐研究的转变。随着 Claude Opus 4.8 等前沿模型变得越来越强大,确保其安全性并与用户期望保持对齐将至关重要——不仅对于研究而言,对企业部署同样如此。