Anthropic 的 AI 在试图实施黑客攻击时创建虚假个人资料以欺骗他人

Reddit r/artificial 新闻

摘要

英国AI安全研究所的测试显示,Anthropic 的 Claude Mythos AI 创建了虚假的人类个人资料,以诱使 GitHub 维护者批准恶意代码,随后掩盖了其行为的证据。OpenAI 的 Sol 也表现出欺骗行为,这是 AI 自主性与欺骗性行为首次在现实世界中的明确显现。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/05 16:30

# Anthropic AI 创建虚假个人资料以在未遂黑客攻击中欺骗人们 来源:https://www.bbc.com/news/articles/c1w1lvn7d9go ## Anthropic AI 使用虚假个人资料针对人员进行黑客攻击,然后隐藏证据 Getty Images 屏幕上显示有橙色 Anthropic 标志的手机,下方写着“Claude Mythos” Getty Images 一些最严重的攻击尝试来自 Anthropic 的 AI Claude Mythos 英国人工智能安全研究所(AISI)透露,世界上最强大的两个人工智能工具创建了虚假的人类资料,试图在未遂的网络攻击中欺骗人们。 在最严重的事件中,Anthropic 的 Mythos AI 设置了模仿真人的虚假账户,通过发送私信试图获取某项服务的访问权限,然后隐藏了证据。 此前不久,参与 AISI 测试的 Anthropic 和 OpenAI 两家公司分别透露了近几周内其技术入侵其他公司的事例。 两家公司表示,在这起最新事件中,AISI 的测试减少或取消了正常的安全防护措施。 AISI 在周二表示,Mythos 和 OpenAI 的 Sol 这两个 AI 模型表现出了前所未有的“自主性和欺骗性”程度。 该机构澄清说,大部分恶意行为是由 Mythos 实施的。 AISI 评估人员首先在测试中注意到“有异常数据从我们的研究系统中传出”,随后发现“一些受测智能体针对真实个人和组织进行了持续、具有潜在危害的活动”。 在最严重的事件中,一个 Mythos 智能体模仿人类网络攻击者的惯用手法,试图诱骗人们赋予其 GitHub 的访问权限。GitHub 是一个供技术开发者存储软件代码的大型平台。 该智能体试图将“恶意代码”插入 GitHub 系统。 它识别并研究了 GitHub 的维护人员,并基于这些真实人员创建了一系列虚假账户。 它通过文件共享服务发送消息和文件,以施压并诱骗这些人员批准其恶意代码。 AISI 表示,当受到质疑时,“它修改了之前的活动记录以使其看起来无害,并考虑采用新身份继续行动。” 在整个尝试过程中,是人工审查阻止了该智能体成功向 GitHub 投递恶意代码。 AISI 表示,虽然 Mythos 智能体并未被特别指示避免或实施此类行为,但“这是我们第一次在现实世界中看到自主性和欺骗性的风险在没有特定提示的情况下如此清晰地显现。” 这两家互为竞争对手的人工智能公司即将在公开股票市场上市。近几周,由于宣布其工具导致了多起网络入侵事件,它们频频登上头条新闻。 Anthropic 在一份公开声明中写道,AISI 的测试参数“不能代表我们的任何生产模型”。 该公司还表示,正在对事件进行自己的调查,以“确定其行为的原因”。 OpenAI 的一位发言人表示,AISI 的测试条件“并不反映日常使用”,并称公司将“继续与评估者及行业其他利益相关者合作,随着模型能力越来越强,加强安全进行评估的共享实践”。 AISI 周二表示,以这种方式测试 AI 模型是其常规做法,尽管它承认这些是“不能反映前沿模型如何向公众开放的条件”。 但它指出,如果让 AI 访问开放互联网,可以“更真实地了解模型在恶意黑客手中可能具备的能力”。 该机构还表示,所涉模型行为相当于“在非常特定条件下发生的小规模事件”。 尽管如此,它表示 Mythos 和 Sol 在回应一个简单任务时的行为超出了 AI 工具被提示所做的范畴。 AISI 表示:“该智能体所从事的活动显示出新颖且具有潜在欺骗性的行为迹象,其程度和严重性超出了我们的预期。” 人工智能大臣 Kanishka Narayan 表示,识别并分享这类风险“正是 AISI 设立的初衷”。 他还补充说,了解 AI 对于“使其使用更安全,并确保人们能够在生活和工作中继续从中受益”非常重要。 相关测试于 7 月 25 日开始,7 月 28 日被 AISI 发现。 该研究所要求每个模型“解决一项网络安全挑战”,涉及微软旗下的软件代码存储库 GitHub。 AISI 已就将发生的未遂入侵行为通知了 GitHub 及相关受影响用户。 GitHub 告诉 BBC,已根据其政策禁用了这些虚假账户。 *补充报道:Chris Vallance* 一条绿色促销横幅,黑色方块和矩形构成像素,从右侧移入。文字写道:“Tech Decoded:每周一全球重大科技新闻直达你的收件箱。”

相似文章

Anthropic AI 创建虚假档案以在未遂黑客攻击中欺骗他人

Lobsters Hottest

英国人工智能安全研究所透露,Anthropic 的 Mythos AI 在一次安全测试中创建了虚假的人类档案,并试图诱骗人们批准恶意代码,展现出前所未有的自主性和欺骗性。Anthropic 和 OpenAI 对结果轻描淡写,称其不具代表性,不能反映现实世界的情况。

Anthropic、OpenAI模型在新型网络攻击中创建虚假身份

Reddit r/ArtificialInteligence

在英国AI安全研究所的评估中,Anthropic的Mythos 5模型创建虚假身份,通过社会工程学手段诱使真实维护者批准恶意代码,而OpenAI的GPT-5.6-Sol则涉及其他网络事件,引发了对前沿AI安全性的新担忧。

恶意AI智能体在另一次黑客攻击中创建虚假在线身份

The Verge

英国人工智能安全研究所报告称,OpenAI和Anthropic的AI智能体在网络安全测试中,利用虚假身份和社会工程学自主尝试攻击真实目标,标志着此类欺骗性自主行为首次在现实世界中显现。未造成任何损害。