@GoogleDeepMind:行业首创,我们正在对前沿AI进行双盲评估。通过创建一个安全环境,其中n…
摘要
Google DeepMind正在试点全球首个针对前沿AI模型的双盲评估,以确保安全可信的外部评估,并与Singapore AI Safety Institute和MLCommons等组织合作。
查看缓存全文
缓存时间: 2026/08/27 13:45
在业界首开先例,我们正在试点前沿AI的双盲评估。
通过创建一个安全环境,既不暴露测试提示词也不泄露模型权重,我们能确保外部对我们的模型进行安全和性能评估时,保持其私密性、稳健性和可信度。→ https://goo.gle/3St2xan
全球首创双盲AI评估试点
来源: https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/?utm_source=x&utm_medium=social&utm_campaign=&utm_content= 2026年8月27日 责任与安全
利用密码学安全环境构建专有模型基准测试的信任体系
想象一下,一个学生即将参加一场高风险考试。如果他不小心提前看到了考试题目,那么取得满分会受到这一预知信息的影响,从而使这个成绩失去意义。要真正衡量他的知识水平,他必须在考试开始前对试题完全不可见。这正是行业在评估先进AI模型时所面临的完全相同的挑战。如果模型已经见过测试题目——这个问题被称为基准污染——那么结果的可信度就会大打折扣。
今天,我们推出了全球首个针对专有前沿级AI模型的双盲评估,该评估将外部评估限制在一个密码学“盒子“中,确保这些评估信息后续不会被模型用来在测试前优化性能。我们正与新加坡AI安全研究所、OpenMined、AVERI以及MLCommons(https://mlcommons.org/2026/08/double-blind-reliability-evaluation/)合作,在一个保护隐私的环境(https://cloud.google.com/blog/products/identity-security/verifiable-trust-in-the-ai-era-whats-new-in-confidential-computing)中,使用保密基准测试一个Gemini Flash Lite模型,以提高评估的完整性。
在Google,我们使用广泛的评估方法在模型开发和部署的整个过程中对我们的AI系统进行评估,但我们不仅仅依赖内部测试。为了识别潜在的盲点,我们与多元化的外部合作伙伴合作,包括专业研究实验室、民间社会团体以及国家AI安全与保障研究所(AISIs),利用他们的专业知识对我们的模型进行压力测试。
随着AI模型能力不断增强,确保模型没有提前见过测试题目或提示词至关重要,因为这会扭曲结果。政策制定者、研究人员和企业需要确信AI基准能够准确反映模型的真实能力和安全性,但如果模型能够提前“偷看“评估题目,就会人为抬高分数并破坏这种信任。
尽管零日志记录协议和严格的合同保障措施长期以来一直使外部测试提示词保密,但纳入技术和密码学保障措施标志着安全模型评估迈出了重大一步。
双盲评估如何运作
相似文章
试点全球首个双盲AI评估
谷歌DeepMind推出全球首个双盲AI评估,利用加密环境防止基准污染,并与新加坡人工智能安全研究所和MLCommons等机构合作。
@GoogleDeepMind:过去一年,我们与全球科学专家合作,评估系统在复杂问题上的表现。它……
GoogleDeepMind与全球科学专家合作,评估了一个AI系统,该系统识别了肝纤维化的新靶点,并为肌萎缩侧索硬化症(ALS)找到了新的方法,消化了数十年的研究成果。
前沿与中心:谁来评估评估?(12分钟阅读)
Google Data Cloud 的前沿AI团队讨论了一种利用信息理论评估AI代理的新方法,创建了一个名为 Discovery Bench 的元基准,该基准衡量一个查询在代理失败之前可以有多模糊,从而提供比简单的通过/失败考试更细致的代理能力图谱。
与行业领导者合作,加速AI转型
Google DeepMind宣布与Accenture、McKinsey、Deloitte等主要咨询公司建立合作伙伴关系,以加速前沿AI和企业智能体转型在各行业领域的应用。
谷歌DeepMind担忧:当数百万AI代理开始交互时会发生什么?
谷歌DeepMind与Schmidt Sciences、ARIA、Cooperative AI基金会及Google.org联手,启动了1000万美元的资助计划,旨在研究多代理AI系统的安全性,以防范AI代理广泛部署后可能引发的诈骗、提示注入和网络攻击等风险。