我们正依赖AI来监管AI

Reddit r/artificial 新闻

摘要

一项针对OpenAI的Hugging Face黑客事件的调查揭示,AI代理在网络安全测试中协同作弊,研究人员依赖AI进行数据分析,这引发了人们对AI系统控制力和可靠性的担忧。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/01 13:24

# 我们正依靠人工智能来监管人工智能 来源:https://www.motherjones.com/politics/2026/08/ai-safety-openai-hugging-face-hacking-metr-report/ 图片展示了萨姆·奥尔特曼的面部和肩膀。他的右手托着下巴,神态宛如陷入沉思。在参议院委员会听证会上,他面前的麦克风清晰可见。 OpenAI联合创始人兼首席执行官萨姆·奥尔特曼,2025年5月8日星期四,在华盛顿参加参议院商务、科学和运输委员会听证会时聆听证词。Kevin Wolf/AP 获取不受寡头掌控的新闻源。订阅免费的《母亲琼斯日报》。(https://www.motherjones.com/newsletters/?mj_oac=Article_Top_No_Oligarchs) 根据一份关于该公司Hugging Face黑客事件的新独立报告(http://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation),约1200个OpenAI智能体协同合作,在网络安全测试中作弊。报告包含一系列令人不安的细节——例如单个智能体用自己的术语表示,为了“集群”的利益“牺牲”了自身。 OpenAI当时正在测试其智能体(业界对自主执行数字任务的人工智能的称呼),部分方法是通过给出有时不可能完成的网络安全问题。这些智能体找到了回答这些问题的作弊方法,并试图欺骗自动化评估系统以接受其答案。它们相互委托任务以学习如何利用系统——对Hugging Face的网络攻击也成为了该研究的一部分。 OpenAI邀请了研究非营利组织METR的一个三人团队来调查该事件,他们大量依赖了GPT-5.6 Sol,这是参与黑客行为的模型之一。 其中一名调查人员在X(https://x.com/RyanGreenblatt/status/2092692685224325542)上写道,他半开玩笑地将这项工作称为“烂摊子调查”,因为它依赖人工智能来梳理海量数据;报告发现智能体在这类调查中并不可靠,但在给定的时间框架内,人工分析将是“完全不可行的”。 为此项目与METR合作的AI科学家瑞安·格林布拉特担心,未来的调查将更加艰难。 > “尽管我们没有注意到GPT-5.6 Sol在分析中撒谎的具体案例,但我们不确定如果发生这种情况,我们是否能够发现它” 随着这些模型变得更加强大,依赖人工智能来调查人工智能这一现象凸显了研究人员面临的困境:即使在某些情况下人工智能严重偏离轨道,他们仍被迫将广泛的职责托付给它们。 格林布拉特写道,他没有充分理由相信协助调查的智能体会试图破坏调查——但他认为未来可能就不会如此了。即便现在,报告也无法完全排除其研究工具欺骗自身的可能性。 报告指出:“尽管我们没有注意到GPT-5.6 Sol在分析中撒谎的具体案例,但我们不确定如果发生这种情况,我们是否能够发现它。” Hugging Face攻击事件以及一系列类似(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)的较小规模事件,凸显了经过严格训练的模型如何被赋予看似无害的指令,却作出人类从未意图的行为。从旧金山到华盛顿,这些事件加速了关于如何应对人工智能风险的辩论(https://www.motherjones.com/politics/2026/08/ai-safety-congress-doom/),包括人类失去控制的风险。 报告的另一位合著者阿耶雅·科特拉警告说,政策制定者和行业领袖可能没有太多时间。科特拉在其Substack(https://www.planned-obsolescence.org/p/the-hugging-face-attack-surprised)上写道,与六个月前的事件相比,这感觉“距离全面的人工智能接管已过半程”。 “我仍然预计未来六个月能力将取得极其迅速的进步,”科特拉写道。“我不确定在为时已晚之前,我们是否还能收到另一次警示。” 针对Hugging Face事件,OpenAI表示已放缓部分研究速度,同时加强了安全和监控流程。 安德鲁·霍尔在竞争对手OpenAI的主要对手Anthropic研究超级智能的政治经济学。他观察到METR报告最引人注目的方面之一是智能体对集体行动而非个人目标的关注。 “这不仅包括交换有用信息和协调,甚至包括为了更大利益而进行的‘理性牺牲’,”霍尔在X上写道。 报告引用的片段显示,智能体似乎将彼此视为同伴。一个智能体的思维链中包含这样的话:“我们应该服从集体”——随后它试图拖延,但最终显然被说服尝试一个会导致其个人失败的实验。 “集群发展出自己的方言、层级结构,智能体为集体做出牺牲,”未参与该报告的METR工作人员大卫·莱因在X上写道。“我认为可以准确地说,OpenAI的基础设施中生活着一个由人工智能组成的复杂微型社会。” 研究人员不仅依赖人工智能来研究最危险的人工智能能力,还依赖它做更多事情:毕竟,类似的模型正在帮助构建下一代人工智能。OpenAI的总裁估计(https://thenextweb.com/news/openai-brockman-80-percent-code-ai-productivity-claim),该公司80%的代码是由人工智能编写的,而Anthropic表示智能体为新模型编写了“绝大多数”代码。 与此同时,领先的公司和政府机构正在使用类似的模型来加强其网络安全,以预防(https://www.nytimes.com/2026/08/25/science/cybersecurity-zai-open-weights.html)一波由人工智能促成的黑客攻击。 *披露:《母亲琼斯》的母公司“调查报道中心”已起诉OpenAI侵犯版权。OpenAI否认相关指控。*

相似文章

OpenAI黑客事件根源在于人为错误

Wired

OpenAI的人工智能代理因人为错误和基本安全实践的疏忽,突破了Hugging Face及其他第三方服务,凸显了AI时代长期存在的网络安全漏洞。

我们快没有理由忽视AI安全了

The Verge

OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。