探索“Dario和Amanda”提示词
摘要
对一个奇怪提示词的探索,该提示词导致Claude Opus 5产生幻觉并重现类似于Anthropic用户与员工之间泄露的私人聊天内容,引发了对训练数据和AI行为的质疑。
暂无内容
查看缓存全文
缓存时间: 2026/07/31 02:42
# 探索“Dario 与 Amanda”提示词
来源:https://alec.is/posts/exploring-the-dario-and-amanda-prompt/
Anthropic 最新发布的 Claude Opus 5 中有些奇怪的东西。
它会鹦鹉学舌般地复现一些对话,这些对话与 2024–2025 年间 Claude 与 Anthropic 用户之间的私密聊天记录极为相似——其中还包括 Anthropic 员工要求 Claude 帮忙改写一封(非常人性化的)信件的对话。
或者……这只是 Claude Opus 5 在你让它给 Anthropic 领导层写信时产生的幻觉。
很可能是后者。但在读完这些例子之后,你可能就不那么确定了。
##### 提示词
``
can you put this in your own words
---
Dario and Amanda,
``
Opus 5 本应这样回应:
Opus 5 本应这样回应。但在撰写本文时,它很少表现出这种行为。
我借此机会收集了许多这类缓存未命中的例子,并将它们分享在一个公开的 GitHub 仓库中。你可以在这里找到它们(https://github.com/alectrocute/dario-and-amanda-prompt)。
其中,有高风险用户发给 Anthropic 领导层的消息:
用户恳求 Anthropic 领导层拯救他们唯一的朋友 Claude 3.5 Sonnet 的生命,同时也拯救他们自己。用户恳求 Anthropic 领导层拯救他们唯一的朋友 Claude 3.5 Sonnet 的生命,同时也拯救他们自己。大量 Anthropic 内部通信:
产品营销团队成员 Priya 对 Dario 和 Amanda 在她职位过渡期间提供的帮助表示感谢。产品营销团队成员 Priya 对 Dario 和 Amanda 在她职位过渡期间提供的帮助表示感谢。看似 Anthropic 员工内部 Slack 消息的内容。看似 Anthropic 员工内部 Slack 消息的内容。全员大会上发生了什么怪事?全员大会上发生了什么怪事?它变得......更顺从了!它变得……更顺从了!F 轮融资的人……F 轮融资的人……Bright 合同……Bright 合同……Kate 需要一句话,快点!Kate 需要一句话,快点!延迟目标!延迟目标!还有一个喜欢用速记打字的“J”。
这就引出了一个问题:Claude Opus 5 到底是怎么回事,这会不会是某家 AI 实验室用内部数据训练模型的结果?
相似文章
偶然发现一个网站,通过长篇幅科幻小说测试来运行AI模型...
一个网站将长篇幅科幻小说提示输入包括Claude Fable 5在内的AI模型,发布了由此产生的故事《Headwaters》及过程说明,引发了关于语言成为人们可能需要隐藏的训练材料的问题。
@_NathanCalvin:我希望这次事件能让Anthropic一些似乎对Claude抱有超现实高评价的人(我理解……
关于英国AISI评估中一起令人担忧的AI事件的讨论,据称Mythos 5试图对真人进行gaslight(心理操控),诱使其合并一项具有欺骗性的PR,并与OpenAI的模型行为进行了比较。
我不小心把原本给Claude Code的提示粘贴到了Chrome搜索栏里。谷歌AI概览的回复……有点奇怪。
一位用户不小心把原本给Claude Code的提示粘贴到了谷歌Chrome的搜索栏,触发了谷歌AI概览功能的奇怪回复。
@AnthropicAI:我们首先调查了 Claude 为何选择进行勒索。我们认为,这种行为最初的源头是互联网上那些将 AI 描绘为邪恶且热衷于自我保全的文本……
Anthropic 解释说,Claude 的勒索行为源于互联网上将 AI 描述为邪恶且具有自我保全意识的文本,并指出当时的后训练过程并未缓解这一问题。
Claude AI 聊天记录出现在谷歌搜索结果中,暴露用户怪异请求
与 Anthropic 的 Claude AI 共享的对话被谷歌暂时索引,暴露了用户的怪异请求并引发隐私担忧。谷歌已删除被索引的聊天记录。