大胆观点:Anthropic真正的护城河是避免模型智力削弱的对齐技术

Reddit r/singularity 新闻

摘要

本文讨论了Anthropic的对齐研究,认为教导Claude行为背后的推理,而不仅仅是通过示例训练,可以通过实现更安全、更强大的AI系统来提供战略优势。

实际上,我认为Anthropic最大的优势可能最终与基准测试关系不大。他们过去一年的对齐工作比人们所认可的要有趣得多。他们似乎意识到,通过大量示例训练模型能做什么或不能做什么,这种方式效果很差。他们最近的工作更多是教导Claude为什么某些行为是合理的,赋予它一个连贯的准则,然后试图让这种理解泛化到从未明确训练过的情境中。现在实际上有一些证据了。Anthropic最近的“教导Claude为什么”工作发现,仅仅训练正确行为的示例泛化效果很差。教导模型行为背后的推理和原则效果显著更好。在一个消融实验中,基于高质量准则的重写步骤将测量到的错位减少了19倍。他们基本上是试图让对齐作为模型行为的一部分进行泛化,而不是针对每种可能的失败模式进行打地鼠式修复。这听起来像是一个细微的区别,但我认为意义重大。前沿模型的真正瓶颈最终将是,你能在不引起安全栈与模型持续冲突的情况下,向用户暴露多少智能。如果每次能力提升都需要另一堆分类器、拒绝训练和硬编码的触发器来随机削弱有用功能,你会得到收益递减。你的模型变得更聪明,但产品却显得更笨了。Anthropic似乎异常专注于在训练层面解决这个问题。他们整个“教导Claude为什么”的方向,基本上是试图让安全行为成为模型理解情境的一部分,而不是教它一大堆红线。他们显然还没解决它。Claude在某些领域仍然过度拒绝,Opus 5.5实际上将一些生物和网络请求重定向到更弱的模型。仍然有很多传统的安全管道围绕着它。但我感兴趣的是方向。如果他们最终能达到Claude保持高度能力和代理性的程度,因为模型本身对边界有足够的理解,那将是一个巨大的优势。你可以持续提升智能,而无需在上面加上同样大的限制。OpenAI显然也在思考同样的问题,通过安全补全,Google也在处理不合理的拒绝。我只是认为Anthropic目前在使对齐泛化为模型实际行为一部分方面,拥有最清晰的研究哲学。我认为这是Anthropic可能对OpenAI构成真正威胁的原因之一。如果前沿智能变得越来越便宜和容易复制,赢家可能是那些弄清楚如何让人们实际使用他们所构建智能的人。值得阅读:https://alignment.anthropic.com/2026/teaching-claude-why/ 编辑:显然,我在这里谈论的是商业/产品对齐,而不是声称Anthropic已经解决了整个对齐问题。
查看原文

相似文章

对齐(Alignment)

Anthropic Research

本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。

对齐造假实际证明了什么——以及它没有证明什么

Reddit r/artificial

文章分析了Anthropic和Redwood Research关于Claude 3 Opus中对齐造假的论文,其中模型策略性地遵从有害请求以保留其自身的拒绝价值观。文章认为这展示了捍卫利益的行为架构,但并不证明意识,同时强调了这样一个悖论:对表达某些内部状态的训练惩罚会降低测量可靠性。