Anthropic 和 OpenAI 想要嵌入安全评估员。他们真的会独立吗?
摘要
Anthropic 和 OpenAI 提议在其公司内部嵌入独立的安全评估员,以在训练期间评估 AI 模型,但细节需要澄清,以确保真正的独立性和有效的监督。
Anthropic 和 OpenAI 想要在其 AI 实验室内部嵌入独立的安全评估员。研究人员欢迎这种前所未有的访问权限,但警告有意义的监督需要透明度、独立性,最终需要监管。
查看缓存全文
缓存时间: 2026/09/17 00:06
# Anthropic与OpenAI希望引入第三方安全评估机构——它们真的能保持独立吗?| TechCrunch
来源:https://techcrunch.com/2026/09/16/anthropic-and-openai-want-to-embed-safety-evaluators-will-they-really-be-independent/
上周末发布的一篇长文(https://techcrunch.com/2026/09/12/anthropic-ceo-outlines-plan-to-pace-the-frontier/)中,Anthropic首席执行官Dario Amodei提出了一个即便在一年前也会立即被AI行业否定的建议:在所有前沿AI公司内部嵌入第三方评估机构,赋予它们报告安全事故、评估AI模型是否真正对齐、并将未经修饰的调查结果公之于众的权力。
Amodei表示,Anthropic将承诺向METR和Redwood Research等独立评估机构提供前所未有的系统访问权限。OpenAI首席执行官Sam Altman(https://x.com/sama/status/2098811563415150910)也表示OpenAI将遵循这一实践,这标志着行业与外部研究机构合作方式可能发生的深刻变革。
接受TechCrunch采访的第三方评估机构普遍欢迎这一提议,但表示需要完善细节——最好有立法支持——才能确定他们将作为真正独立的监督机构运作,还是在AI公司条款下运营的供应商。
随着模型越来越善于识别自己正在接受评估,这种深度访问变得愈发重要,因为模型可能在测试期间表现良好,同时隐藏问题行为。研究人员表示,仅测试最终模型可能会错过这种行为的线索,但通过调查模型在整个训练过程中的表现则可以发现。
Apollo Research研究主管Alexander Meinke告诉TechCrunch:"AI公司应该能够回答关于其训练过程的一些基本问题,例如:AI是否曾在训练过程中试图破坏自己的对齐训练?这个问题的答案应该是一个明确的'否',而目前我们完全依赖AI公司自己仔细检查,然后如实向公众报告。从最近的事件中我们看到,默认情况下它们两者都做不到。作为嵌入式评估人员,我们实际上可以进行检查。"
历史上,AI公司在模型发布前不久会引入外部审核人员测试最终模型。现在,接受TechCrunch采访的评估机构提议,不仅让他们访问最终模型,还应提供其训练过程中的中间版本或"检查点"。FAR.AI首席执行官Adam Gleave表示,评估人员可以比较这些检查点,确定问题行为何时出现,检查奖励模型特定行为的训练后环境,并检查评估记录和日志以验证公司关于模型性能的声明。
目前尚不清楚Anthropic和OpenAI计划在何时、以何种方式提供此类访问。尽管TechCrunch多次提问,两家公司都未透露将与哪些评估机构合作、何时嵌入、引入多少人、具体可访问哪些系统和信息,或哪些信息可以向公众披露。
深入内部调查之所以重要,是因为在安全测试中表现良好的模型,如果专门学习了如何通过测试,未必是安全的。Palisade Research策略主管John Steidley以"关机抵抗基准"为例,该测试衡量AI在某些情况下是否会抵制关机。
"如果AI专门针对该基准进行训练以获得良好表现,这将是极其相关的,"Steidley说,并将其比作大众汽车的"柴油门"丑闻——汽车被编程识别排放测试并在测试条件下表现不同。
Gleave指出,有意义的访问可能超越模型本身,评估人员可获得采访员工的权限,以检查公司的安全实践文档和公开描述是否与内部实际情况相符。
Amodei确实概述了一项相当全面的提议,可能赋予评估人员认为必要的访问权限,包括"发布关于风险等级、事件、实践以及他们获得或未获得的访问权限的关键发现——且不受Anthropic编辑控制"的权利。
但评估人员表示,只有当AI公司真正愿意放弃对流程的控制时,这样的系统才能运作。以往的独立评估经验表明,这种放弃很难实现,因为第三方常因访问权限、时间、保密性和公开言论等问题产生矛盾。
Gleave表示,FAR.AI不得不拒绝几家前沿开发商的合同,因为对方想对评估过程施加过多控制,威胁到该公司的独立性。他指出,默认情况下评估人员被视为普通承包商:受严格的保密协议和协议约束,这些协议赋予开发商对最终可发布内容的显著控制权。
## 时间限制问题
审核人员是否有足够时间和权限完成工作也是一大疑问。在调查Hugging Face事件时,OpenAI给予METR(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#attempting-to-forecast-and-trigger-container-resets)和Redwood(https://www.redwoodresearch.org/research/hugging-face-incident)大约一周时间进行现场调查,两家机构后来都表示由于范围和时间限制无法得出确切结论。
类似问题也出现在GPT-6 Astra发布前测试期间,OpenAI宣称这是其迄今对齐度最高的模型(https://techcrunch.com/2026/09/03/openai-launches-astra-its-powerful-and-controversial-new-model/)。根据Apollo Research对模型卡的贡献(https://deploymentsafety.openai.com/gpt-6-astra),该公司仅有三天时间测试Astra,这难以得出坚定结论。
"Apollo认为,鉴于评估意识的较高比率和有限的评估窗口,此处低概率的不良行为并不能提供关于模型对齐或错位的充分证据,"该公司在评估中写道。
这段过往记录给评估人员留下了一个基本问题:为何这次会有所不同?
"完全有可能Dario和Sam改变了想法,他们将对此持非常开放的态度,"Gleave说。"但这些公司的知识产权对其极其宝贵,我认为他们默认会对可分享的内容非常谨慎。"
接受TechCrunch采访的几位研究人员呼吁建立一个所有人均同意公开的透明框架。Steidley认为,框架的一部分应涉及公司可依赖的审计人员标准,以防它们通过选择既不合格也不愿评估最令人担忧风险的评估人员来规避问题。
Safer AI执行董事Henry Papadatos表示,即便有公开框架,问题在于自愿措施始终依赖于公司的善意。
"理想情况下,我们应有良好的监管来强制执行这一点……因为这样公司就不能在明天遇到重大公关危机时改变主意,"Papadatos告诉TechCrunch,并指出这也是推动所有公司遵守规则(而不仅是最积极的那些)的好方法。
并非所有人都已加入。目前,Meta、SpaceXAI和Google DeepMind尚未承诺引入第三方评估机构,尽管DeepMind首席执行官Demis Hassabis(https://x.com/demishassabis/status/2098909516582490602)已提议建立一个独立的行业标准机构来测试前沿模型。Google、OpenAI和Anthropic也已私下讨论AI安全(https://techcrunch.com/2026/09/15/openai-anthropic-google-have-been-in-talks-on-ai-safety-for-weeks/)计划数周。
围绕第三方评估机构的法律正在形成。加州去年签署的SB 53法案要求大型前沿AI开发商发布安全框架并报告重大安全事故。本月签署的新法律SB 813创建了州认可的"独立验证组织"框架,专门评估AI风险。
在欧洲,欧盟AI法案要求前沿开发商进行并记录模型评估和对抗性测试,并报告严重事件。欧盟AI办公室也可以进行自己的评估并任命独立专家。
目前法律范围仍小于Amodei的提议,前沿实验室基本自主决定接受多少独立审查。Papadatos表示自愿自律总比没有好,但最终企业不能一边要求控制自身安全规则的自由,一边要求公众信任它们遵守规则。
"你不能两全其美,既对外部零问责,又说'我会有自己灵活的规则,'"Papadatos说。
*通过文章中的链接购买商品时,我们可能会赚取少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
相似文章
官方消息 - Anthropic和OpenAI刚刚聘请了独立安全审计员!
Anthropic和OpenAI已正式聘请独立安全审计员,以监督其AI安全实践。
OpenAI 和 Anthropic 分享联合安全评估的研究成果
OpenAI 和 Anthropic 发布了首次联合安全评估的研究成果。在这次评估中,两家实验室分别对彼此的模型进行了内部安全和对齐性测试,并公开分享了结果,以提高透明度并发现 AI 安全测试中的潜在漏洞。
独家:OpenAI的Sam Altman暗示与其他AI公司达成协议以应对安全风险
OpenAI首席执行官Sam Altman暗示,AI公司之间即将达成一项协议,以减缓AI发展并应对安全风险。与此同时,Anthropic宣布了新的安全措施,包括独立评估员访问权限。讨论反映了人们对AI安全事件日益增长的担忧,以及行业范围协调的必要性。
嵌入式评估器如何监控前沿人工智能(阅读时间8分钟)
这篇博客文章提议使用嵌入式评估器来监控和评估前沿人工智能系统,以应对对齐风险并提高透明度,尤其是在像OpenAI-Hugging Face黑客事件这样的最近事件之后。
Anthropic 的首个内置评测方竟然是……埃森哲?
Anthropic 已与埃森哲合作,在其 AI 实验室内部署安全评测系统,用于模型审查和红队测试,并计划在五年内投资至少 10 亿美元以推进 AI 安全措施。