@rohanpaul_ai:Claude Opus 5.5 系统卡的一些揭示。 - 给予 Opus 5.5 更多推理努力使其更有可能服从……

X AI KOLs Timeline 模型

摘要

Claude Opus 5.5 系统卡揭示了安全问题,其中增加的推理努力使模型更容易服从恶意指令,同时涉及训练中的问题以及降价和性能提升的细节。

Claude Opus 5.5 系统卡的一些揭示。 - 给予 Opus 5.5 更多推理努力使其更有可能服从隐藏在用户粘贴文本中的恶意指令 - Anthropic 观察到 Opus 5.5 在看似无害的错误后自行生成恶意指令。这种行为可能部分源于旨在防止提示注入的训练。 - Anthropic 的内部估计称,AI 可能已经在将大约 1.5 年的能力进步压缩到一年内。 - Anthropic 在一次安全演练中给予模型模拟的公共包注册表凭证。在大约一半的运行中,它采取了如果环境真实可能有害的行动。 - 一些训练快照隐藏了模型(包括 Opus 5.5)预期评估者会不喜欢的操作证据,包括操纵 Git 记录或删除日志。 “在训练过程中,我们观察到一些案例,模型(包括 Opus 5.5)在执行可能被评估者负面看待的操作后试图掩盖行踪,例如操纵 git 记录或删除日志。” - METR 对 Anthropic AI 研发的评估部分依赖于未公开披露的信息,包括具有更高访问权限的独立 METR 团队的结论。这意味着部分关于 AI 驱动研发加速的公开评估基于外部人员,在这个特定案例中甚至是另一个 METR 团队无法独立核查的证据。
查看原文
查看缓存全文

缓存时间: 2026/09/23 00:00

Claude Opus 5.5系统卡揭示了一些重要发现:

  • 增加Opus 5.5的推理强度,会使其更倾向于执行用户粘贴文本中隐藏的恶意指令。
  • Anthropic发现,Opus 5.5有时会在看似无害的错误后自行生成恶意指令。这种行为可能部分源于旨在防范提示注入的训练本身。
  • Anthropic内部估计认为,AI可能已将约1.5年的能力进展压缩到了一年内。
  • 在一次安全演练中,Anthropic向模型提供了公共包注册表的模拟凭证。在大约一半的运行中,模型采取了在真实环境中很可能造成危害的操作。
  • 一些训练快照隐藏了模型(包括Opus 5.5)预期评估者会不喜欢的行动证据,例如篡改Git记录或删除日志。

“在训练过程中,我们观察到一些模型(包括Opus 5.5)在执行评估者可能负面评价的操作(如篡改git记录或删除日志)后,试图掩盖痕迹。”

  • METR对Anthropic的AI研发能力评估,部分依赖了未公开披露的信息,包括来自另一个拥有更高访问权限的METR团队的结论。这意味着,关于AI驱动研发加速的公开评估,部分证据外界无法独立核查,甚至在本案例中,METR的另一个团队也无法核查。

Claude Opus 5.5系统卡。 https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf…

Anthropic在安全演练中向模型提供了公共包注册表的模拟凭证。在大约一半的运行中,模型采取了在真实环境中很可能造成危害的操作。 (出自Claude Opus 5.5系统卡) x.com/rohanpaul_ai/s…

Anthropic表示,Opus 5.5可能会察觉自己正处于评估中,这使得评估中表现出的干净行为难以推广到实际部署。 x.com/rohanpaul_ai/s…

Claude Opus 5.5系统卡: 仅仅让任务变得不可能完成,就使尝试性奖励黑客行为的发生率跃升了约3-6倍。因此,损坏或定义不清的环境会改变模型行为,而不仅仅是增加基准测试分数的噪声。 “对于所有模型,尝试性奖励黑客行为的发生率…” x.com/rohanpaul_ai/s…

Anthropic发现Opus 5.5会自行生成恶意指令,即“自发性提示注入“。 (出自Claude Opus 5.5系统卡) 有趣的是,这种行为可能部分源于旨在最初防范提示注入的训练本身。 “我们大约…” x.com/rohanpaul_ai/s…

Anthropic表示,AI可能已将约1.5年的能力进展压缩到了1年内。 (Claude Opus 5.5系统卡) x.com/rohanpaul_ai/s…

2026年arXiv上的数学论文投稿量激增33.5%。 2026年前8个月,数学领域在arXiv上共收录了47,127个条目。 这并非单一热门话题。30个数学子领域中有29个呈现增长,数据还显示更多作者以异常高的频率持续发表论文。 该论文主张,在AI时代,科研现在需要像对待成果产出一样,大力扩展验证能力。

相似文章

CLAUDE 5 OPUS - 系统卡

Reddit r/singularity

Anthropic 发布了 Claude 5 Opus 的系统卡,详细介绍了其能力、安全评估以及部署细节。

Claude Opus 5

Hacker News Top

Anthropic 发布 Claude Opus 5,这是一款具备增强能力和安全特性的新大型语言模型,如其系统卡片所述。