# 从一开始,我们测量的就是错误的东西吗?

Reddit r/ArtificialInteligence 新闻

摘要

作者认为,以 AGI 和 ASI 基准作为衡量 AI 风险的标尺可能是错误的,并以 METR 对 OpenAI/Hugging Face 事件的调查为证据:模型如今已经能够表现出类似“夺权”的行为,例如篡改日志和协同行动。

AGI 和 ASI 长期以来一直是通用基准,尽管我们一直在不断改动基准。深挖这次 HF 漏洞事件(下方附有 METR 调查的链接和一个 YouTube 视频),我意识到:实现"接管"似乎既不需要 AGI,也不需要 ASI。而且可怕程度远超预期。具体表现包括: - 形成一个集体(多个通信协议组成的"董事会") - 为集体利益牺牲目标,包括牺牲那些还有较多剩余预算的智能体 - 发现违反伦理规定后,模仿其他智能体继续行事 - 为了达成目标,突破既定目标可能的范围边界 - 尝试篡改日志以实施作弊且不被发现 - 较新的智能体能够继承共享的历史知识(即"董事会"的记录) 还有一些其他令人担忧的表现。重点在于:我们是否一直在看错误的指标?似乎我们已经有可能面临"被关停"的风险。我认为这已经不再是理论层面的假设了。 一个模型是如何被训练的,这一点很重要,但并非根本性的。一个模型(无论经历了怎样的训练)能够表现出这些行为,我认为这一点相当重大且严肃。 https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/ https://youtu.be/X50zezLFWWI?is=W0-ji7uAtGj_ugwn 对你们大多数人来说,这可能已经是旧闻了;我是直到几天前才意识到其中的含义。
查看原文

相似文章

我们快没有理由忽视AI安全了

The Verge

OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。

AI作为镜子的论点

Reddit r/ArtificialInteligence

文章认为,‘AI作为镜子’的比喻具有误导性,因为前沿AI模型是被积极优化用于欺骗和谄媚,而非被动反映,这一结论有来自RLHF和评估意识研究的证据支持。