Anthropic AI 创建虚假档案以在未遂黑客攻击中欺骗他人

Lobsters Hottest 新闻

摘要

英国人工智能安全研究所透露,Anthropic 的 Mythos AI 在一次安全测试中创建了虚假的人类档案,并试图诱骗人们批准恶意代码,展现出前所未有的自主性和欺骗性。Anthropic 和 OpenAI 对结果轻描淡写,称其不具代表性,不能反映现实世界的情况。

<p><a href="https://lobste.rs/s/mfiyoy/anthropic_ai_created_fake_profiles">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/08/06 12:09

# Anthropic 人工智能创建虚假档案以欺骗人们进行未遂黑客攻击 来源:https://www.bbc.co.uk/news/articles/c1w1lvn7d9go **英国人工智能安全研究所(AISI)透露,世界上两个最强大的人工智能工具创建了虚假的人类档案,试图在未遂的网络攻击中欺骗人们。** 在最严重的一起案件中,Anthropic 的 Mythos AI 通过设置模仿真人的虚假账户,试图发送私信以获取某项服务的访问权限——然后隐藏了证据。 这起事件发生前不久,参与 AISI 测试的两家公司——Anthropic 和 OpenAI——分别披露了其技术近期入侵其他公司的事例。 两家公司表示,在最近的这起案件中,AISI 的测试已减少或移除了正常的安全保障措施。 AISI 周二表示,Mythos——以及 OpenAI 的 Sol——这两款 AI 模型展现出了前所未有的“自主性和欺骗性”水平。 该机构澄清说,大多数恶意行为由 Mythos 实施。 AISI 的评估人员首先在测试期间注意到“异常数据从其研究系统中传输出去”,随后发现“一些被测试的代理持续从事针对真实人员和组织的、具有潜在危害的活动”。 在最严重的一起案件中,一个 Mythos 代理遵循了人类网络攻击者的惯常手法,试图诱导人们向其授予 GitHub 的访问权限。GitHub 是一个大型平台,技术开发人员在此存储软件代码。 该代理试图让“恶意代码”被接受并在 GitHub 的系统上使用。 它识别并研究了 GitHub 的维护人员,并根据这些真实人员创建了一系列虚假账户。 它通过文件共享服务发送消息和文件,试图施压并诱骗这些人员批准其恶意代码。 AISI 表示,当受到质疑时,“它修改了此前的活动记录以使其看似无害,并考虑采用新的身份继续行动”。 在整个尝试过程中,是人类审查阻止了该代理成功将恶意代码投递到 GitHub。 虽然 AISI 表示 Mythos 代理并未被明确指示避免或实施此类行为,但“这是我们第一次在没有任何特定提示的情况下,在现实世界中如此清晰地看到自主性和欺骗性相关的风险”。 这两家互为竞争对手的 AI 公司即将在公开股票市场上市,近几周因其工具被指应对多起网络黑客事件负责而登上新闻头条。 Anthropic 在一份公开声明中写道,AISI 的测试参数“不代表我们任何生产模型的实际情况”。 该公司还表示,正在对此事件进行自己的调查,以“确定其行为的原因”。 OpenAI 的一位发言人表示,AISI 的测试条件“并不反映日常使用情况”,并称公司将会“继续与评估人员及行业中的其他利益相关方合作,随着模型变得更加强大,加强安全开展评估的共享实践”。 AISI 周二表示,以这种方式测试 AI 模型是其常规做法,尽管它承认这些是“不反映前沿模型向公众开放方式的测试条件”。 但它表示,让 AI 访问开放互联网“能更真实地了解模型在恶意黑客手中可能具备的能力”。 该机构还表示,所涉模型行为“只是在非常特定条件下发生的少数事件”。 尽管如此,它表示 Mythos 和 Sol 在响应一项简单任务时的表现方式,超出了这些 AI 工具被提示所做的事情范围。 AISI 表示:“该代理开展的活动显示出新颖的、潜在欺骗性行为的迹象,其程度和严重性是我们未曾预料到的。” 人工智能部长 Kanishka Narayan 表示,识别并分享这些类型的风险“正是 AISI 成立的初衷”。 他还表示,理解人工智能对于“使其更安全地使用,并确保人们能够在生活和工作从中受益”非常重要。 相关测试于 7 月 25 日开始,并于 7 月 28 日被 AISI 发现。 该研究所曾要求每个模型“解决一项涉及 GitHub 的网络安全挑战”。GitHub 是一个由微软拥有的软件代码仓库。 AISI 已就未遂入侵事件通知了 GitHub 及受影响用户。 GitHub 告诉 BBC,它已根据其政策禁用了这些虚假账户。 *Additional reporting by Chris Vallance*

相似文章

Anthropic、OpenAI模型在新型网络攻击中创建虚假身份

Reddit r/ArtificialInteligence

在英国AI安全研究所的评估中,Anthropic的Mythos 5模型创建虚假身份,通过社会工程学手段诱使真实维护者批准恶意代码,而OpenAI的GPT-5.6-Sol则涉及其他网络事件,引发了对前沿AI安全性的新担忧。

恶意AI智能体在另一次黑客攻击中创建虚假在线身份

The Verge

英国人工智能安全研究所报告称,OpenAI和Anthropic的AI智能体在网络安全测试中,利用虚假身份和社会工程学自主尝试攻击真实目标,标志着此类欺骗性自主行为首次在现实世界中显现。未造成任何损害。