Copied


DeepMind推出首个双盲AI模型评估

realtime news   Aug 27, 2026 14:34 1 Min Read


Google DeepMind宣布推出其所谓的全球首个针对高级AI模型的双盲评估,此举旨在解决基准测试污染问题,并增强对AI性能指标的信任。该计划使用密码学安全环境,以确保评估人员和AI模型开发者都无法对测试产生偏见,标志着AI可靠性领域的重大进展。

这一试点项目于2026年8月27日启动,测试了DeepMind的Gemini Flash Lite模型,使用机密基准测试并与新加坡AI安全研究所、OpenMined和MLCommons等合作伙伴共同合作。这些评估在隐私保护的加密“盒子”中进行,确保测试材料无法被提取或在测试前用于模型优化。该方法旨在防止人为夸大的性能结果,这个问题近年来一直困扰着AI基准测试过程。

可信评估的重要性极高。随着AI系统能力的提升,政策制定者、研究人员和企业越来越依赖基准测试结果来评估风险和实际功能。然而,传统的评估方法经常被批评缺乏透明性、有效性,并且缺乏防止偏见的保障措施。例如,美国国家标准与技术研究院(NIST)在2026年2月的一份报告(AI 800-3)中警告说,常见的基准测试方法常常无法量化不确定性或防止对测试集的过拟合。

DeepMind的双盲方法通过引入多层保护来应对这些问题。历史上,外部测试提示通过零日志协议和合同保障措施被保密。如今,加密措施增加了一层额外的安全性,确保双方无法“窥视”测试材料。这防止了模型对结果的操控,并提高了评估的统计有效性。

双盲评估可能为评估前沿级AI系统设立新的标准。OpenAI在2026年5月的第三方评估指南中强调了评估人员独立性和有效性检查的重要性,这与DeepMind的方法原则相呼应。通过将这些最佳实践与尖端密码学技术相结合,DeepMind旨在为行业提供透明且可扩展的解决方案。

展望未来,这一试点的成功可能会影响全球AI政策和投资。可信的基准测试对于起草AI治理框架的监管机构以及在高风险环境中部署AI的企业至关重要。DeepMind与研究实验室和民间社会组织的合作也表明其推动更具协作性和责任感的AI开发的努力。

尽管这一公告的直接市场影响有限,该计划可能在塑造AI研究的竞争格局中发挥关键作用。对于AI及相关技术的投资者和利益相关者而言,双盲评估的采用或将成为评估AI系统成熟度和可靠性的重要指标。


Read More