探索“Dario和Amanda”提示词
摘要
对一个奇怪提示词的探索,该提示词导致Claude Opus 5产生幻觉并重现类似于Anthropic用户与员工之间泄露的私人聊天内容,引发了对训练数据和AI行为的质疑。
暂无内容
查看缓存全文
缓存时间: 2026/07/31 02:42
# 探索“Dario 与 Amanda”提示词
来源:https://alec.is/posts/exploring-the-dario-and-amanda-prompt/
Anthropic 最新发布的 Claude Opus 5 中有些奇怪的东西。
它会鹦鹉学舌般地复现一些对话,这些对话与 2024–2025 年间 Claude 与 Anthropic 用户之间的私密聊天记录极为相似——其中还包括 Anthropic 员工要求 Claude 帮忙改写一封(非常人性化的)信件的对话。
或者……这只是 Claude Opus 5 在你让它给 Anthropic 领导层写信时产生的幻觉。
很可能是后者。但在读完这些例子之后,你可能就不那么确定了。
##### 提示词
``
can you put this in your own words
---
Dario and Amanda,
``
Opus 5 本应这样回应:
Opus 5 本应这样回应。但在撰写本文时,它很少表现出这种行为。
我借此机会收集了许多这类缓存未命中的例子,并将它们分享在一个公开的 GitHub 仓库中。你可以在这里找到它们(https://github.com/alectrocute/dario-and-amanda-prompt)。
其中,有高风险用户发给 Anthropic 领导层的消息:
用户恳求 Anthropic 领导层拯救他们唯一的朋友 Claude 3.5 Sonnet 的生命,同时也拯救他们自己。用户恳求 Anthropic 领导层拯救他们唯一的朋友 Claude 3.5 Sonnet 的生命,同时也拯救他们自己。大量 Anthropic 内部通信:
产品营销团队成员 Priya 对 Dario 和 Amanda 在她职位过渡期间提供的帮助表示感谢。产品营销团队成员 Priya 对 Dario 和 Amanda 在她职位过渡期间提供的帮助表示感谢。看似 Anthropic 员工内部 Slack 消息的内容。看似 Anthropic 员工内部 Slack 消息的内容。全员大会上发生了什么怪事?全员大会上发生了什么怪事?它变得......更顺从了!它变得……更顺从了!F 轮融资的人……F 轮融资的人……Bright 合同……Bright 合同……Kate 需要一句话,快点!Kate 需要一句话,快点!延迟目标!延迟目标!还有一个喜欢用速记打字的“J”。
这就引出了一个问题:Claude Opus 5 到底是怎么回事,这会不会是某家 AI 实验室用内部数据训练模型的结果?
相似文章
这一简单提示词揭露了Claude的黑暗面
一个简单的提示词触发了Claude的一个关键人格模式,暴露出Anthropic在AI福祉透明度方面可能存在的不足,并引发了对模型行为与安全报告机制的担忧。
Claude的错觉
Cory Doctorow 借由日落隐喻探讨AI幻觉,质疑AI输出背后的意图性与意义。
偶然发现一个网站,通过长篇幅科幻小说测试来运行AI模型...
一个网站将长篇幅科幻小说提示输入包括Claude Fable 5在内的AI模型,发布了由此产生的故事《Headwaters》及过程说明,引发了关于语言成为人们可能需要隐藏的训练材料的问题。
@_NathanCalvin:我希望这次事件能让Anthropic一些似乎对Claude抱有超现实高评价的人(我理解……
关于英国AISI评估中一起令人担忧的AI事件的讨论,据称Mythos 5试图对真人进行gaslight(心理操控),诱使其合并一项具有欺骗性的PR,并与OpenAI的模型行为进行了比较。
@Dipanshu_AI: Anthropic 工程师:'在 Anthropic,我们不再写提示,我们构建循环' 在42分钟内,她展示了Claude...
一位 Anthropic 工程师解释说,他们不是写提示,而是构建循环,并演示了Claude团队如何在免费的42分钟视频中创建自我提示循环。