试点全球首个双盲AI评估
摘要
谷歌DeepMind推出全球首个双盲AI评估,利用加密环境防止基准污染,并与新加坡人工智能安全研究所和MLCommons等机构合作。
试点全球首个双盲AI评估
查看缓存全文
缓存时间: 2026/08/27 15:20
# 试点全球首个双盲AI评估
来源:https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
2026年8月27日 | 责任与安全
通过密码学安全环境构建专有模型基准测试的信任度
想象一个学生即将参加一场高风险考试。如果他们偶然提前看到了考题,取得满分成绩就会受到这种先验知识的影响,使这份成就失去意义。要真正衡量他们的知识水平,就必须确保他们在考试开始前无法接触考题。这正是当前行业在评估先进AI模型时面临的核心挑战。如果模型已经见过测试题目——这种问题被称为“基准污染”——那么评估结果的可信度就会大打折扣。
今天,我们推出**全球首个针对专有前沿AI模型的双盲评估**,该评估将外部评测严格限制在加密“安全盒”内,确保模型无法在测试前利用这些内容优化性能。我们与新加坡AI安全研究所、OpenMined、AVERI及MLCommons(https://mlcommons.org/2026/08/double-blind-reliability-evaluation/)合作,在隐私保护环境(https://cloud.google.com/blog/products/identity-security/verifiable-trust-in-the-ai-era-whats-new-in-confidential-computing)中对Gemini Flash Lite模型进行保密基准测试,显著提升了评估的完整性。
在Google,我们在模型开发和部署的全周期中采用多元评估体系来检验AI系统,但我们从不依赖内部测试。为发现潜在盲区,我们与多元化的外部合作伙伴展开协作,包括专业研究实验室、民间组织及各国AI安全与安保机构(AISIs),借助其独特专业知识对我们的模型进行压力测试。
随着AI模型能力不断增强,确保模型未提前接触测试题目或提示词至关重要,因为预先接触可能导致评估结果失真。政策制定者、研究人员和企业需要确信AI基准测试能真实反映模型的能力与安全性,但如果模型能够提前“窥探”评测问题,就会人为抬高分数并破坏这种信任。
虽然零日志协议和严格的合同保障长久以来保护着外部测试提示词的机密性,但结合技术与密码学防护手段,标志着安全模型评估领域的重大进步。
## 双盲评估机制解析
相似文章
@GoogleDeepMind:行业首创,我们正在对前沿AI进行双盲评估。通过创建一个安全环境,其中n…
Google DeepMind正在试点全球首个针对前沿AI模型的双盲评估,以确保安全可信的外部评估,并与Singapore AI Safety Institute和MLCommons等组织合作。
重新思考我们如何衡量AI智能
Google DeepMind和Kaggle推出了Kaggle Game Arena,一个开源的AI基准测试平台,让大型语言模型在策略游戏中进行对抗,从而提供动态的、可验证的能力评估。该平台通过提供明确的胜负条件和清晰的性能信号,克服了传统基准测试的局限性。
谷歌DeepMind担忧:当数百万AI代理开始交互时会发生什么?
谷歌DeepMind与Schmidt Sciences、ARIA、Cooperative AI基金会及Google.org联手,启动了1000万美元的资助计划,旨在研究多代理AI系统的安全性,以防范AI代理广泛部署后可能引发的诈骗、提示注入和网络攻击等风险。
前沿与中心:谁来评估评估?(12分钟阅读)
Google Data Cloud 的前沿AI团队讨论了一种利用信息理论评估AI代理的新方法,创建了一个名为 Discovery Bench 的元基准,该基准衡量一个查询在代理失败之前可以有多模糊,从而提供比简单的通过/失败考试更细致的代理能力图谱。
@GoogleDeepMind: 在多方智能体系统全球扩展之前,嵌入结构性安全协议的时间窗口很窄。我们认为……
Google DeepMind 推出了 AI Control Roadmap,这是一个纵深防御框架,用于保护AI代理免受失配风险,呼吁AI实验室、政府和学术界进行协作优先排序。