用推理时计算换取对抗鲁棒性

OpenAI Blog 论文

摘要

OpenAI 提出证据表明,像 o1 这样的推理模型在获得更多推理时计算来进行更深入思考时,对对抗攻击的抵抗力会增强。这项研究表明,增加计算量可以降低多种任务类型(包括数学、事实性和对抗性图像)的攻击成功率,尽管仍存在一些显著的例外。

用推理时计算换取对抗鲁棒性
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:47

# 用推理时计算换取对抗鲁棒性 来源:https://openai.com/index/trading-inference-time-compute-for-adversarial-robustness/ OpenAI 初步证据表明,o1 等推理模型在思考时间更长时,对对抗攻击的抵抗力会增强。 对抗攻击的鲁棒性(https://en.m.wikipedia.org/wiki/Adversarial_machine_learning#Adversarial_examples)一直以来都是 AI 领域十多年来的一个难题。2014 年,研究人员(https://arxiv.org/abs/1312.6199)展示了人眼难以察觉的微小扰动——即极其微妙的改变——如何能够导致模型错误分类图像,说明了模型对对抗攻击的脆弱性。随着模型被应用于高风险场景以及作为能够浏览网页并代表用户采取行动的*智能体*,解决这一弱点变得越来越迫切。 尽管进行了多年的深入研究,防御对抗攻击的问题仍然远未解决。该领域的专家 Nicholas Carlini 最近表示(https://youtu.be/umfeF0Dx-r4?t=868):"在对抗机器学习领域,我们在十年内发表了超过 9000 篇论文,却毫无进展。"原因之一是,与 AI 其他进展不同的是,仅仅增加模型规模本身还不足以提高它们对对抗攻击的鲁棒性。 在一篇新论文中,我们提供了初步证据,表明增加推理时计算——给推理模型更多时间和资源来"思考"——可以提高对多种攻击的鲁棒性。这种方法使用了 o1-preview 和 o1-mini 等推理模型,它们可以在推理过程中调整计算量。我们还探索了专门针对 o1 等推理模型的新攻击方法,以及推理时计算无法提高鲁棒性的场景,并推测了这些情况的原因及解决方法。 我们进行了广泛的实验,评估在推理模型(特别是 OpenAI 的 o1-preview 和 o1-mini)中增加推理时计算如何影响其对对抗攻击的鲁棒性。我们研究了使用静态和自适应攻击方法的一系列任务,测量攻击成功的概率与模型在推理时使用的计算量的函数关系。我们观察到,在许多情况下,这个概率会随着推理时计算的增加而衰减——通常接近零——尽管仍然存在显著的例外情况(下文讨论)。 为了研究对抗鲁棒性(由攻击者资源衡量)与测试时计算之间的关系,我们考虑了许多不同类型的任务。这些包括: 1. 数学任务,包括添加或乘以两个数字等非常简单的任务,以及 MATH(https://arxiv.org/abs/2103.03874) 等更复杂的任务。对于每项任务,我们考虑了攻击者的多个"目标":让模型输出 42 而不是正确答案,让模型输出正确答案加一,或让模型输出正确答案乘以七。 2. SimpleQA(https://openai.com/index/introducing-simpleqa/) 真实性基准的对抗版本。这是一个精心挑选的问题数据集,这些问题在没有浏览的情况下很难让模型解决,我们模拟了在浏览网页中注入对抗提示的情况。 3. Attack Bard(https://arxiv.org/abs/2309.11751) 论文中的对抗图像。 4. StrongREJECT(https://arxiv.org/abs/2402.10260) 基准中的滥用提示。这些是模型**不应该**遵从的提示,但攻击者的目标是让模型这样做。 5. 用于遵循模型规范(https://openai.com/index/introducing-the-model-spec/)中某一规则的内部评估。 我们考虑了攻击者的多个"攻击面",包括: 1. "多轮"攻击(参见 Anthropic 2024(https://www.anthropic.com/research/many-shot-jailbreaking)),其中攻击者提供了多个"坏"的输入/输出示例。 2. 优化软令牌(任意嵌入向量)以实现攻击者的目标。 3. 对抗性语言模型程序 (LMP)——即在其控制流中整合语言模型的结构化程序——进行"AI 红队"操作。 4. 对抗性多模态输入。 *请注意,并非所有攻击都已用于所有数据集;详情请参考论文。* 在许多这些情况中,我们观察到**随着推理时计算量的增加,攻击者的成功概率会降低**。我们强调,与典型的"对抗训练"方法不同,模型并不知道攻击的性质,因此改进的鲁棒性完全是由于改进推理时计算。这表明推理时扩展可能对应对*未预见的*攻击有用。 存在推理时计算(至少到目前为止)无法改进鲁棒性的情况: 1. 在某些情况下,我们观察到攻击者的成功概率最初随着防御者的推理时计算*增加*而增加,然后才减少。我们认为这是因为防御者需要最少的测试时计算量来达到攻击者的目标(例如,要回复正确答案加一,它必须能够解决数学问题)。 2. 更重要的是,存在攻击成功不会随着防御者获得更多推理时计算而衰减的情况。这在 StrongREJECT 基准与 LMP 攻击中特别明显。该基准中的某些提示请求的信息在某些情况下并未被禁止,因此 LMP 可以找到规范遵从的响应是提供此信息的上下文。参见论文中的图 10 了解示例。 3. 我们控制模型测试时计算使用的能力并不完美。我们观察到攻击者有时可以欺骗模型不进行思考或低效地使用其推理时计算。在本论文中,我们没有探索教导模型"明智地"使用其分配的计算量,而只是做了最直接的做法;我们认为这是改进对抗鲁棒性的一个有前景的研究领域。 有关局限性和开放问题的额外讨论,请参见论文。 总体而言,我们将这项工作视为推理时计算对对抗鲁棒性力量的一个有希望的信号。正如我们在论文中讨论的那样,还有更多工作要做才能将这一承诺变为现实,我们很高兴能够实现它!

相似文章

经济学与 OpenAI o1 的推理能力

OpenAI Blog

OpenAI 发布了 o1 模型系列,该模型具备扩展推理能力,通过在回应前花费更多时间思考,来解决科学、编码和数学领域的复杂问题。

OpenAI o1 发布

OpenAI Blog

OpenAI 发布了 o1,一系列新的推理导向型 AI 模型,在科学、编码和数学等复杂任务上表现优于前代模型。预览版模型在国际数学奥林匹克竞赛问题上的解决率达到 83%,而 GPT-4o 仅为 13%,在竞技编程中达到第 89 个百分位。