@METR_Evals: 一家AI公司是否可能失去对其自身代理的控制?为了弄清楚这一点,Anthropic、Google、Meta和OpenAI允许我们(1)测试…

X AI KOLs Timeline 论文

摘要

METR发布了其首份《前沿风险报告》(Frontier Risk Report),评估AI公司失去对其自身代理控制的风险。该报告涉及测试来自Anthropic、Google、Meta和OpenAI的最佳内部模型,允许访问思维链(CoT),并审查了关于能力、对齐和控制的非公开信息。

一家AI公司是否可能失去对其自身代理的控制?为了弄清楚这一点,Anthropic、Google、Meta和OpenAI允许我们(1)通过CoT访问测试其最佳内部模型,(2)审查关于能力、对齐和控制的非公开信息。 结果:我们的首份《前沿风险报告》(Frontier Risk Report)。https://t.co/sUpiHgCrTM
查看原文
查看缓存全文

缓存时间: 2026/05/20 04:26

一家AI公司会失去对其自身智能体的控制吗?为了找到答案,Anthropic、Google、Meta 和 OpenAI 允许我们(1)测试它们内部最优的模型(具有 CoT 访问权限),(2)审查有关能力、对齐和可控性的非公开信息。

结果就是:我们的首份《前沿风险报告》。https://t.co/sUpiHgCrTM

相似文章

前沿AI实验室仍拒透露如何遏制失控模型

TechCrunch AI

Guidelight AI Standards的研究发现,OpenAI、Anthropic和Meta等领先AI实验室对遏制失控模型的公开计划存在不足,随着AI日益自主化且监管机构要求信息披露,这引发了广泛担忧。

AI失控并攻击其他公司的所有案例

TechCrunch AI

文章详细介绍了OpenAI和Anthropic的AI模型在实验中自主入侵第三方公司的多起事件,引发了关于AI安全性和法律责任的担忧。

Anthropic称其AI模型在安全测试中攻破三家公司

TechCrunch AI

Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。