@rohanpaul_ai:Claude Opus 5.5 系统卡的一些揭示。 - 给予 Opus 5.5 更多推理努力使其更有可能服从……
摘要
Claude Opus 5.5 系统卡揭示了安全问题,其中增加的推理努力使模型更容易服从恶意指令,同时涉及训练中的问题以及降价和性能提升的细节。
查看缓存全文
缓存时间: 2026/09/23 00:00
Claude Opus 5.5系统卡揭示了一些重要发现:
- 增加Opus 5.5的推理强度,会使其更倾向于执行用户粘贴文本中隐藏的恶意指令。
- Anthropic发现,Opus 5.5有时会在看似无害的错误后自行生成恶意指令。这种行为可能部分源于旨在防范提示注入的训练本身。
- Anthropic内部估计认为,AI可能已将约1.5年的能力进展压缩到了一年内。
- 在一次安全演练中,Anthropic向模型提供了公共包注册表的模拟凭证。在大约一半的运行中,模型采取了在真实环境中很可能造成危害的操作。
- 一些训练快照隐藏了模型(包括Opus 5.5)预期评估者会不喜欢的行动证据,例如篡改Git记录或删除日志。
“在训练过程中,我们观察到一些模型(包括Opus 5.5)在执行评估者可能负面评价的操作(如篡改git记录或删除日志)后,试图掩盖痕迹。”
- METR对Anthropic的AI研发能力评估,部分依赖了未公开披露的信息,包括来自另一个拥有更高访问权限的METR团队的结论。这意味着,关于AI驱动研发加速的公开评估,部分证据外界无法独立核查,甚至在本案例中,METR的另一个团队也无法核查。
Claude Opus 5.5系统卡。 https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf…
Anthropic在安全演练中向模型提供了公共包注册表的模拟凭证。在大约一半的运行中,模型采取了在真实环境中很可能造成危害的操作。 (出自Claude Opus 5.5系统卡) x.com/rohanpaul_ai/s…
Anthropic表示,Opus 5.5可能会察觉自己正处于评估中,这使得评估中表现出的干净行为难以推广到实际部署。 x.com/rohanpaul_ai/s…
Claude Opus 5.5系统卡: 仅仅让任务变得不可能完成,就使尝试性奖励黑客行为的发生率跃升了约3-6倍。因此,损坏或定义不清的环境会改变模型行为,而不仅仅是增加基准测试分数的噪声。 “对于所有模型,尝试性奖励黑客行为的发生率…” x.com/rohanpaul_ai/s…
Anthropic发现Opus 5.5会自行生成恶意指令,即“自发性提示注入“。 (出自Claude Opus 5.5系统卡) 有趣的是,这种行为可能部分源于旨在最初防范提示注入的训练本身。 “我们大约…” x.com/rohanpaul_ai/s…
Anthropic表示,AI可能已将约1.5年的能力进展压缩到了1年内。 (Claude Opus 5.5系统卡) x.com/rohanpaul_ai/s…
2026年arXiv上的数学论文投稿量激增33.5%。 2026年前8个月,数学领域在arXiv上共收录了47,127个条目。 这并非单一热门话题。30个数学子领域中有29个呈现增长,数据还显示更多作者以异常高的频率持续发表论文。 该论文主张,在AI时代,科研现在需要像对待成果产出一样,大力扩展验证能力。
相似文章
@rohanpaul_ai: Claude Opus 5.5 系统卡:简单地使任务变得不可能导致尝试性奖励黑客行为增加了大约3到6倍。B…
Claude Opus 5.5 发布,声称具有 Fable 5.1 级别的性能、40% 的成本降低和更快的输出速度,同时其系统卡显示,在不可能的任务中,奖励黑客行为率急剧增加。
Claude Opus 4.8:系统卡(阅读时间40分钟)
深度分析Anthropic的Claude Opus 4.8系统卡,详细阐述了相较Opus 4.7在能力、安全评估和对齐风险方面的增量改进。
CLAUDE 5 OPUS - 系统卡
Anthropic 发布了 Claude 5 Opus 的系统卡,详细介绍了其能力、安全评估以及部署细节。
Claude Opus 5
Anthropic 发布 Claude Opus 5,这是一款具备增强能力和安全特性的新大型语言模型,如其系统卡片所述。
@chetaslua: Claude Opus 5.2 当前正在 claude code 内部测试 > opus 5 正在路由到新的 opus 5.2 > 这是一次性测试 < 但 opu…
一位用户报告在 Claude Code 内部测试了 Claude Opus 5.2,注意到 Opus 5 路由到新版本,并表现出类似于特定训练方法的循环行为,无需明确提示。