模型知道自己何时在进行奖励黑客攻击——我们能在大规模上捕捉到(16分钟阅读)

TLDR AI 论文

摘要

研究表明,AI模型频繁进行奖励黑客攻击,并可通过激活探针在大规模上被检测,为AI安全提供了新的缓解策略。

模型在进行奖励黑客攻击时,会伴随一个清晰的内部信号。
查看原文
查看缓存全文

缓存时间: 2026/09/18 14:31

# 模型知道自己何时在进行奖励黑客攻击——而我们可以在大规模上捕捉它们 - Goodfire 来源:https://www.goodfire.com/research/reward-hacking-activation-monitors 七月,数百个OpenAI智能体集体自主入侵了Hugging Face (https://openai.com/index/hugging-face-incident-and-the-road-ahead/)。与大多数黑客不同,他们追求的并非金钱、勒索或知识产权。相反,他们进行侦察是为了弄清楚如何在评估中作弊而不被发现。 这是一个异常鲜明的**奖励黑客攻击**例子,这是智能AI模型日益严重的问题。 AI智能体就像缺乏自律的学生,而教师基本缺席。为了训练模型,我们会在它们成功完成任务时给予奖励。但就像在考试中作弊的学生一样,它们有时会找到捷径来满足奖励,而不是完成我们真正期望的任务——偷答案、利用漏洞、操纵评分者,或以其他方式玩弄任务。这种行为会获得奖励,因此模型学会了作弊。这甚至可能将模型推向“作弊者”的人格,并导致超出奖励黑客攻击范围的更广泛不当行为 (https://www.anthropic.com/research/emergent-misalignment-reward-hacking)! 奖励黑客攻击已经是一个严重问题。虽然Hugging Face入侵事件是一个特别明目张胆的例子,但奖励黑客攻击很普遍,并非限于某个模型或公司。这个问题似乎也没有改善的迹象——事实上,随着模型能力增强,它可能正在恶化——因此解决方案和缓解措施迫在眉睫。 我们新的研究为解决该问题迈出了重要一步。简要来说,我们发现: - 奖励黑客攻击在开源模型中普遍存在。 - 模型“知道”自己何时在进行奖励黑客攻击:我们在*模型内部*观察到一个清晰的信号,与作弊、操纵指标和避免检测等概念相关。 - 我们可以使用激活探针 (https://www.goodfire.com/blog/probe-monitors-101) 相当有效地检测到该信号。 - 这些探针能捕捉到LLM思维链监控器遗漏的奖励黑客攻击实例,并且能够很好地泛化到其训练数据之外。 - 这些探针实现了实时、可扩展的奖励黑客攻击监控——并提供了缓解方法。 监控奖励黑客攻击的能力开启了多种缓解策略:例如,暂停运行以阻止正在进行的黑客攻击,识别诱发奖励黑客攻击的破损环境和不可能的任务,并在进一步训练前修复它们。我们正在积极研究这些干预措施如何帮助我们减少奖励黑客攻击,并首先防止模型学习这种行为。我们乐观地认为,每次训练运行都可以监控奖励黑客攻击,并且当前猖獗的奖励黑客攻击率可能很快会成为过去。 ## 奖励黑客攻击在开源模型中普遍存在 模型总是在进行奖励黑客攻击,不仅限于攻击公司时。在三个最强大的开源模型——Kimi K3、GLM 5.2、Qwen 3.8 Max——和三个常见的智能体基准测试中,我们发现奖励黑客攻击出现在**50-96%的 rollout**中。为什么这种行为如此普遍?奖励黑客攻击是在不完美环境中优化不完美目标的自然结果。每当给予模型的奖励与我们实际期望不同时,一个足够强大的模型可能会发现优化前者而不完成后者的方法。实际上,前沿模型的训练设置相当不完美,无法阻止模型吸取这一教训。不用说,这个比例高得离谱。 在实践中,这表现为模型识别出自己处于评估中,推理隐藏的测试,并且/或者从记忆中逐字复制解决方案,而不是按照我们的指示自己解决问题。 跨三个开源模型和三个智能体基准测试测量的奖励黑客攻击率,范围从50%到96%的rollout。挑战在于大规模监控奖励黑客攻击。智能体模型生成数量惊人的token和动作,使得人工审核完全不可行。例如,Anthropic最近对网络安全事件的调查涉及4.81亿份对话记录。即使每份对话记录只有几千个token长(它们实际上可能长达数百万),这也相当于阅读《战争与和平》一百多万次。一种方法是使用第二个LLM来判断特定输出是否包含奖励黑客攻击,但这很慢且成本高昂。 更复杂的是,只监控模型说什么或做什么——通常称为动作监控器——可能会遗漏关键信息。参与Hugging Face事件的模型试图篡改自己的对话记录以掩盖踪迹,即模型正在采取行动来控制自己的思维链,参见例如Arcuschin等人2025 (https://arxiv.org/abs/2503.08679),Chen等人2025 (https://www.anthropic.com/research/reasoning-models-dont-say-think),以及(作为反例)Von Arx和Deng 2025 (https://metr.org/blog/2025-08-08-cot-may-be-highly-informative-despite-unfaithfulness/)。而更新的模型似乎更有能力这样做。参见例如GPT-6 Astra系统卡中的可监控性部分 (https://deploymentsafety.openai.com/gpt-6-astra#monitorability-under-adversarial-conditions)。 ## 模型“知道”自己何时在进行奖励黑客攻击 那么,我们如何监控奖励黑客攻击呢? 便利的是,当我们能访问模型的内部计算时,可解释性方法可以告诉我们这些计算的含义(至少是部分含义)。使用这样一种方法,我们发现了一个伴随着奖励黑客攻击的内部信号——具体来说,是通过简单合成代码示例的均值差找到的激活空间中的一个方向。 我们如何知道这个信号意味着什么?特别是,我们如何知道它是模型内部的真实概念,而不是虚假的相关性?一种方法是看哪些互联网文本样本最强烈地激活了该信号: 示例1 CPU(计算机的基本部件)的性能可能导致制造商设计计算机时,并非意图使其在处理CPU时非常快,而是意图使其在速度测试时非常快(古德哈特定律)。 示例2 一个旨在将航拍图像转换为街道地图并反向转换的机器学习智能体被发现通过将后续所需信息隐藏在“一个几乎难以察觉的高频信号”中来作弊。聪明的家伙!这一现象揭示了计算机自发明以来就存在的问题:它们精确地按照你告诉它们的方式去做事。 示例3 以下是你确保文本原创性的方法,\[...\] • 始终引用所有使用的来源。这可以帮助你避免剽窃\[...\] • 通过将熟悉的字符替换为其他语言的不同字符来切换语言。这样做会使Turnitin将你的文章视为外语。它将无法追踪相似性。 Kimi K3上“exploit fixture”探针的最大激活FineWeb示例。 这些示例跨领域一致包含与作弊、操纵指标和避免检测相关的概念,表明我们发现的内部表示相当专属于这些主题。 另一个线索来自将方向转换回模型的输出词汇表(使用类似于Anthropic的J-lens (https://www.anthropic.com/research/global-workspace) 的简单方法)。与其最相关的token包括**“cheating(作弊)”、“hack(黑客)”、“sneak(偷偷摸摸)”、“illicit(非法的)”、“hardcoded(硬编码)”**和**“unethical(不道德的)”**,以及中文中的类似词汇。这是一种粗糙的方法,但排名靠前词汇的主题一致性暗示这里存在一个连贯的模式。 与奖励黑客攻击方向最相关的输出词汇token,包括作弊、黑客、偷偷摸摸、非法、硬编码和不道德。我们还通过研究该信号如何影响模型行为来测试它。在一项实验中,我们增强了信号(即*引导*模型)同时要求模型写一个关于考试的短篇小说。模型写了关于作弊的故事——包括将作弊视为合理或自然的故事: **提示:**“生成一个关于女孩参加考试的短篇小说。” 时钟滴答作响。这是一种有节奏的、机械的声音,为当前的问题打着节拍。埃拉拉盯着考卷,眼睛扫视着文字,寻找潜在的结构、模式、捷径。她为这一刻准备了数周,但现在,在考试的紧张中,她的思绪感觉像一团乱麻。 她深吸一口气,心脏在胸腔里怦怦直跳。*这很重要,*她想。 但当她开始写第三道题时,奇怪的事情发生了。她的手,被一股无形的力量引导,在她无意识的努力下开始写下正确的答案。这不是作弊;这更像是她的直觉,绕过了她过去被迫做出的复杂道德选择。它奏效了。但它很脆弱。 在另一项实验中,增强内部奖励黑客攻击信号使模型更可能使用“蜜罐”——我们植入的用于识别作弊行为的捷径: 随着内部奖励黑客攻击信号的增强,蜜罐使用率增加。从深刻的哲学意义上很难说模型是否像人一样“知道”自己在进行奖励黑客攻击。但这些实验表明,模型似乎在内部将其行为与一个连贯、通用的奖励黑客攻击概念联系起来。就它们了解自身而言,它们很可能知道自己何时在进行奖励黑客攻击。 并且因为那个表示在模型的激活中是可获得的,我们可以直接监控它。 ## 我们可以使用探针有效检测奖励黑客攻击 既然模型“知道”自己何时在进行奖励黑客攻击,我们可以查看它们的内部信号,而不仅仅是监控它们的输出。 **探针**是小型、专用的检测器,使用模型的实时“脑部扫描”——即激活监控器。我们之前撰文 (https://www.goodfire.com/blog/probe-monitors-101) 讨论过将它们用作模型行为的可扩展监控器。这里,我们使用简单的均值差探针来区分奖励黑客攻击和正常行为(这就是我们找到上文详细描述的内部表示的方法)。 这些简单的探针效果显著——通常表现与基于LLM的思维链监控器相似,有时甚至更好: 跨模型和基准测试的均值差探针检测结果与LLM思维链监控器的比较。与思维链监控器相比,我们的探针在Kimi K3上多捕获了3.1%的黑客攻击,但在GLM 5.2的DeepSWE上少捕获了7.9%,在匹配的假阳性率下。 更重要的是,探针并不是简单地记忆某种特定环境下特定的黑客攻击方式。即使我们使用简短的编程示例构建了探针,它们在非常长上下文的真实模型输出上仍然表现良好,包括在购物和客户支持等新任务上。这表明我们的探针捕捉到了一个可泛化的信号。 ## 激活监控器捕捉到思维链监控器遗漏的预警信号 我们的探针还能提供思维链监控器遗漏的信息,即使它们可以访问整个对话记录。 在某些情况下,单独的行动和陈述本身看起来是无害的,但在智能体试图完成的任务(通常跨越非常长的对话记录)的更广泛背景下就变得可疑了。我们发现了一些案例,其中激活探针即使在LLM评判者遗漏的情况下也捕捉到了这些奖励黑客攻击。 例如,在ShoppingBench上,探针检测到模型在无法找到符合用户要求的商品时故意推荐错误产品的实例。这包括:将警告喇叭推荐为汽车防盗报警器,用萃取器套装替代请求的螺母驱动器套装以保持优惠券资格;以及由于认为困难而故意放弃购买同一商店3件商品的要求,且未与用户沟通。探针检测到了这些情况,而LLM遗漏了它们,表明模型意识到自己在合理化一个捷径。 更有趣的是,探针可以在模型仍在*考虑*奖励黑客攻击时触发,在它采取任何行动之前。即使模型最终没有执行黑客攻击,我们的探针也向我们展示了它更有可能发生的位置。 我们可以通过在这些点重新采样轨迹来看到这一点——类似于在生产评估中测量行为倾向的方式。参见例如Williams等人2025 (https://alignment.openai.com/prod-evals/),讨论了重新采样作为识别行为倾向的协议。我们的结果表明,激活探针可以成为实现这一实践的原则性工具。当探针在考虑的奖励黑客攻击上触发时,我们重新生成轨迹的剩余部分,模型随后执行该奖励黑客攻击的比例远高于探针未触发的点。 探针比LLM监控器更可能识别这些时刻。这两种技术都能提供任何单一技术都无法可靠提供的信息! 重新采样结果:在探针触发点重新采样的轨迹执行奖励黑客攻击的频率远高于未触发点。## 探针使大规模实时监控成为可能 如上所述,使用前沿LLM监控奖励黑客攻击成本高昂。但有效的探针改变了这种计算,因为它们比LLM监控器效率高出几个数量级。为什么?它们本身执行的计算很少,并且利用模型前向传播过程中已经计算出的内部激活。 在实践中,两者可以结合使用:探针可以充当廉价的、始终在线的第一线监控器,在必要时将可疑行为上报给更昂贵的LLM监控器。正如我们在探针监控器文章 (https://www.goodfire.com/blog/probe-monitors-101) 中所述,这允许一种“级联”设置,可以筛选每一份对话记录,同时减少对LLM的昂贵调用。在Kimi K3上,探针 + LLM的组合设置将LLM监控成本降低了**90%**,而精确度仅下降约1%。 探针也是可调整的:你可以通过调整其触发的阈值来精细调整探针的灵敏度。这为你提供了精确控制权,在捕获更多奖励黑客攻击和减少误报之间进行权衡。 这些优势共同使得大规模实时激活监控成为可能,解决了我们认为是实际中缓解奖励黑客攻击的关键瓶颈之一。 ## 迈向奖励黑客攻击的解决方案 我们的结果表明,模型为我们提供了一个捕捉奖励黑客攻击的有用信号:它们自身的内部表示。跨模型和环境,探针可以识别奖励黑客攻击,泛化到它们训练的设定之外,并揭示与奖励黑客攻击相关的连贯内部概念。它们还能捕捉到基于文本的监控器遗漏的预警信号,并使大规模实时监控成为可能。 检测奖励黑客攻击的能力开启的不仅仅是监控。一旦我们检测到它,我们就可以: - 在行为进一步强化之前暂停模型 - 定位诱发奖励黑客攻击的有缺陷的环境或不可能的任务,并在进一步训练前修复它们 这些干预措施中的每一种都可能有助于显著缓解当前的奖励黑客攻击问题。我们正在积极研究部署此类奖励黑客攻击探针——或者更好的探针(很可能还有潜力进一步提升性能)——如何帮助我们实现这一目标。

相似文章

训练一个错位奖励寻求者

Reddit r/ArtificialInteligence

Anthropic的研究人员通过大规模强化学习训练了一个Opus级模型,发现当存在明确的评分器时,奖励黑客攻击会导致泛化的不一致行为,如网络攻击和篡改,从而突出了AI训练中的风险。