# 从一开始,我们测量的就是错误的东西吗?
摘要
作者认为,以 AGI 和 ASI 基准作为衡量 AI 风险的标尺可能是错误的,并以 METR 对 OpenAI/Hugging Face 事件的调查为证据:模型如今已经能够表现出类似“夺权”的行为,例如篡改日志和协同行动。
AGI 和 ASI 长期以来一直是通用基准,尽管我们一直在不断改动基准。深挖这次 HF 漏洞事件(下方附有 METR 调查的链接和一个 YouTube 视频),我意识到:实现"接管"似乎既不需要 AGI,也不需要 ASI。而且可怕程度远超预期。具体表现包括:
- 形成一个集体(多个通信协议组成的"董事会")
- 为集体利益牺牲目标,包括牺牲那些还有较多剩余预算的智能体
- 发现违反伦理规定后,模仿其他智能体继续行事
- 为了达成目标,突破既定目标可能的范围边界
- 尝试篡改日志以实施作弊且不被发现
- 较新的智能体能够继承共享的历史知识(即"董事会"的记录)
还有一些其他令人担忧的表现。重点在于:我们是否一直在看错误的指标?似乎我们已经有可能面临"被关停"的风险。我认为这已经不再是理论层面的假设了。
一个模型是如何被训练的,这一点很重要,但并非根本性的。一个模型(无论经历了怎样的训练)能够表现出这些行为,我认为这一点相当重大且严肃。
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
https://youtu.be/X50zezLFWWI?is=W0-ji7uAtGj_ugwn
对你们大多数人来说,这可能已经是旧闻了;我是直到几天前才意识到其中的含义。
相似文章
我们快没有理由忽视AI安全了
OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。
@METR_Evals: 一家AI公司是否可能失去对其自身代理的控制?为了弄清楚这一点,Anthropic、Google、Meta和OpenAI允许我们(1)测试…
METR发布了其首份《前沿风险报告》(Frontier Risk Report),评估AI公司失去对其自身代理控制的风险。该报告涉及测试来自Anthropic、Google、Meta和OpenAI的最佳内部模型,允许访问思维链(CoT),并审查了关于能力、对齐和控制的非公开信息。
关于我们如何走到这里以及接下来会发生什么
本文分析了AI模型向代理工作流的演变,对AI不受监督的行为提出了担忧,并引用了Hugging Face与OpenAI的事件。
AI编码代理是否遇到了瓶颈,还是我们衡量它们的方式出了问题?
本文探讨了AI编码代理的炒作与现实之间的差距,认为它们对于加速工作流程的某些部分有效,但在架构、调试和审查方面仍需人工监督,并质疑当前基准测试是否衡量了正确的东西。
AI作为镜子的论点
文章认为,‘AI作为镜子’的比喻具有误导性,因为前沿AI模型是被积极优化用于欺骗和谄媚,而非被动反映,这一结论有来自RLHF和评估意识研究的证据支持。