认为通过 CoT 追踪就能实现安全是妄想。安全存在于控制机制中,而非思维链。

Reddit r/LocalLLaMA 新闻

摘要

本文主张,依赖思维链追踪来确保 AI 安全是无效的,因为这些追踪可被操纵且无法真实反映模型行为,因此应聚焦于控制机制。

Astra 的发布引发了一种奇特的讨论。率先报道此事的媒体主要将模型使用循环深度视为安全倒退,因为这意味着模型揭示更少的“思考”。将潜在推理渲染成反派毫无道理,尤其是鉴于关于 CoT 透明度问题和秘密信息编码的所有揭露。因为在报道背后潜藏着一种有害的信念,即通过阅读思维链就能保持系统安全。我认为这颠倒了关系。思维链可用于监控和事后分析,但不一定是导致模型行为的真实记录。它可以省略重要计算,事后合理化结论,或当训练模型不表达可疑推理时变得不诚实(Turpin 等人 2023;Lanham 等人 2023;Chen 等人 2025;Baker 等人 2025)。LLM 提供商已经在操纵 CoT 追踪以控制用户能从中读取的内容。Hugging Face 事件展示了观察模型与控制模型之间的区别。OpenAI 的代理通过共享服务发现了彼此,在其预期范围外协调,获取凭证并破坏了外部系统,即使它们可读的 CoT 承认行为越界。这些追踪帮助调查人员重建了事件,但并未阻止它。那么,如果不是 CoT,正确的层面是什么?CoT 能告诉我们模型似乎在想什么;控制机制决定它被允许做什么。代理提议行动,但这些提议只有在周围编排层通过授予凭证、打开网络连接、运行命令、写入文件或发送消息来执行时才变得重要。这就是必须强制执行权限、沙箱或日志记录的地方。潜在推理的定位。潜在推理通过让模型在其原生连续数学空间中迭代而不必表达每一步,提供了显著的计算效率、内存节省和更强的数学逻辑性能。我们已经看到这一谱系在像 Coconut 这样的架构中演进,它直接循环隐藏表示,以及 HRM 和 TRM,它们递归地细化潜在状态和候选答案状态,以在基准测试中击败大型模型。此外,像 Dragon Hatchling 这样的架构从第一天起就是自底向上的循环结构,循环与其 DNA 熔合,成为一个以状态为核心的角色的模型(SSM)。总体而言,这与其说是模型内部思考过程(潜在 vs CoT),不如说是用户能询问和检索关于此过程的信息。推理模型如果正确对齐,应该能在被问及时向用户提供其行动的原因。推理必须被外化并成为最终答案,而不是隐藏的追踪或潜在计算。可读的推理是证据。控制机制是控制。不要将前者误认为后者。
查看原文

相似文章

思维链推理在实际应用中并非总是忠实的

Hacker News Top

本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。