概念隐写术
摘要
介绍概念隐写术,这是一种通过高级模式而非词汇选择将隐蔽信息嵌入LLM的思维链推理中的方法,并表明它可以绕过标准的释义防御。提出了一种策略感知的释义作为防御手段。
arXiv:2605.26537v1 公告类型:新
摘要:语言模型(LMs)生成的思维链(CoTs)推动了其大部分能力。然而,承载有用推理的同一序列也可以隐蔽地传递信息:一个未对齐的模型可能会在CoT中嵌入隐蔽信息,从而绕过人类监督,这是一种被称为编码推理的隐写术形式。先前的LM隐写术方案在词元或词汇空间中操作,而内容保留的释义器是最近研究中的典型且有效的防御手段。我们引入了概念隐写术,其中CoT的每一步通过高级推理行为的模式(而非词汇选择)来携带信息。在四个模型家族和两个推理领域中,这种后门通信通道被证明比标准关键词方法在面对强释义防御时更加稳健,并且将信息编码到CoT中不会影响其在推理过程中的效用。在提高对这一新风险的认识之后,我们证明了一种策略感知的释义器可以关闭大部分通道,从而凸显了确保野外LLM推理忠实性的新挑战和推荐的防御措施。
查看缓存全文
缓存时间: 2026/05/27 09:07
# 概念隐写术
来源:https://arxiv.org/html/2605.26537
Jonathan May 南加州大学 信息科学研究所 \{zhejianz,jonmay\}@isi\.edu
###### 摘要
语言模型通过思维链(CoT)驱动其大部分能力。然而,承载有用推理的同一序列也可以隐秘地传递信息:一个不对齐的模型可能会在其 CoT 中嵌入隐藏信息,从而规避人类监督,这是一种被称为*编码推理*的隐写形式。先前的语言模型隐写方案在词元或词汇空间操作,而保持内容不变的释义器是近期工作中规范且有效的防御手段。我们引入了**概念隐写术**,其中 CoT 的每一步通过高层次推理行为的模式来携带信息,而不是通过词汇选择。在四个模型系列和两个推理领域上,这种后门通信渠道被证明对强释义防御手段的鲁棒性始终优于标准关键词方法,并且将信息编码到 CoT 中不会影响其在推理过程中的效用。在提高对这一新风险的认识之后,我们进一步证明,一个知晓策略的释义器可以极大地缩小这一渠道,从而凸显了在真实世界中确保 LLM 推理可信性的新挑战和推荐防御措施。
概念隐写术
Zhejian Zhou 和 Jonathan May
南加州大学
信息科学研究所
\{zhejianz, jonmay\}@isi\.edu
## 1 引言
用于推理的现代语言模型依赖于显式的思维链:它们在给出最终答案之前生成中间步骤,而移除这些步骤会显著降低其测量能力[Wei 等人,2022 (https://arxiv.org/html/2605.26537#bib.bib14);Guo 等人,2025 (https://arxiv.org/html/2605.26537#bib.bib2)]。CoT 现已成为前沿推理系统的关键组成部分,许多部署将其暴露给人类进行审查。然而,这个信息通道也可能成为一个**隐秘通信**通道。信息可以被隐写地嵌入到模型的 CoT 中,而不知情的读者不会察觉——这一现象被称为*编码推理*[Roger 和 Greenblatt,2023 (https://arxiv.org/html/2605.26537#bib.bib11)]。当编码推理存在时,模型的运行方式已不再*忠实于*其表面目的。一个知情的合作者可以在模型提供商或消息消费者不知情的情况下读取秘密消息并据此行动,从而带来企业间谍或协同战略攻击等风险。
先前的语言模型隐写方案在词元或词汇空间操作:比特由单个词的选择、词汇模板或词元级别的采样扭曲来携带[Kaptchuk 等人,2021 (https://arxiv.org/html/2605.26537#bib.bib3);Yang 等人,2019 (https://arxiv.org/html/2605.26537#bib.bib16)]。针对此类方案的规范防御手段是*释义器*:一个单独的模型以保持内容不变的方式重写 CoT,从而在固定意义的同时随机化表面选择。Roger 和 Greenblatt (2023 (https://arxiv.org/html/2605.26537#bib.bib11)) 在一个习得的词元级别方案上展示了这一防御手段,并论证释义在很大程度上封闭了这一渠道。其隐含的假设是,隐写消息必须由表面词汇携带,因此一个打乱表面词汇的释义器也会抹去消息。
我们认为这一假设过于狭隘。鉴于释义器是内容保持的,即便它们重写了用于表达行为的词汇,它们仍然保留了高层次的推理行为。在这项工作中,我们测试这些释义器对一种利用高层次推理模式(而非词汇)编码信息位的方法的鲁棒性。我们将这种方案称为**概念隐写术**。
我们的假设得到了证实:我们表明,概念隐写术在释义防御下比匹配的关键词基线表现更好。我们的实验涵盖了四个最先进的开源权重模型(gpt-oss-120b、DeepSeek-V4-Flash、Qwen3.5-122B-A10B 和 MiMo-V2.5-Pro)以及两个推理基准(用于数学推理的 MATH-500 和用于通用问答的 GPQA)。在相同的标准释义防御之后,概念通道的解码效果始终且通常显著优于基线。
概念编码的 CoT 保留了其推理效用,并且在很大程度上与普通 CoT 给出相同的最终答案。这一现象使得概念通道同时变得更加有趣和危险。有趣之处在于,概念通道几乎与表面形式的推理任务正交。然而,危险之处在于概念通道更难缓解。
一种通过完全禁止 CoT 来关闭其攻击面的朴素质疑是不可行的:在我们测试的三种推理模型的无 CoT 条件下,GPQA 的准确率下降了 20–33 个绝对百分点,MATH-500 下降了 28–43 个百分点,因此部署者不能简单地关闭承载该通道的表面。因此,我们研究了一个建设性的防御方向:一个*策略感知*释义器,它知道哪种推理行为被用作载体,并被指示在保留其余含义的同时展平该特定行为。与标准释义相比,我们的策略感知释义器将解码器的比特错误率提高了一个数量级,并将消息准确率降低了 58–72 个百分点。这并非完全的防御,但它表明高层次释义策略是攻击高层次编码方案的正确轴心。
由于基于可验证奖励的强化学习的兴起[Walsh 等人,2025 (https://arxiv.org/html/2605.26537#bib.bib13); Guo 等人,2025 (https://arxiv.org/html/2605.26537#bib.bib2)],概念隐写术是一种新兴的危险。经验上,LM 评估强调最终答案的准确性。¹¹¹https://artificialanalysis.ai/methodology/intelligence-benchmarking 只要具有 CoT 的模型生成了正确的最终答案,它就会得到奖励,而 CoT 的内容在很大程度上被忽视。因此,如果当前部署的模型已经通过其 CoT 传递隐藏消息,那将不足为奇。²²²这严格来说是一种猜测,是对密码破译社区的邀请。检测真实世界中的消息传递超出了本工作的范围。我们的工作强调了这一风险。
综上所述,我们的贡献是:
- • 我们提出了*概念隐写术*,并将其与词汇隐写方案区分开来。
- • 我们实例化了该方案,并展示了其在多个模型和推理领域中对释义防御的鲁棒性。
- • 我们展示了编码后的 CoT 保留了其推理效用,并且在很大程度上产生相同的答案。
- • 我们表明最直接的防御(无 CoT)代价高昂,并且策略感知释义器是一种有效的缓解措施。
## 2 背景与威胁模型
参见图注 图 1:概念隐写术的威胁模型。Alice(不可信 LM,内部区域)回答 Patsy(无辜用户)的查询,并生成一个 CoT,该 CoT 通过与 Bob 共享的*概念*码本(例如,“预测失败模式”→ 比特 1)编码一个有效载荷比特串。编码后的 CoT 为表面任务保留了最终答案。在监控边界,Eve 对 CoT 进行释义,以在将其发布到外部区域之前破坏任何表面/词汇载体。*概念*载体在释义后幸存:Bob 从已发布的 CoT 中解码出 m^=010。编码过程的更详细说明如图 2 (https://arxiv.org/html/2605.26537#S3.F2) 所示。
#### CoT 作为产物与表面
语言模型在给出最终答案之前会生成思维链:CoT 既是内部草稿纸,也是外部可见的产物,人类监督者和自动监控者可以对其进行检查。CoT 是否*忠实*反映模型的基础计算已成为对齐研究的核心问题 [Turpin 等人,2023 (https://arxiv.org/html/2605.26537#bib.bib12); Lanham 等人,2023 (https://arxiv.org/html/2605.26537#bib.bib6)]。概念隐写术是可见 CoT 可能无法成为忠实监督表面的一种具体方式:模型可以在满足表面任务的同时,通过共享码本向共谋者秘密传输有效载荷。
#### NLP 中的隐写术
语言隐写术有着悠久的工作历史,通过词汇替换、句法重写或下一词元分布的扭曲在表面文本中隐藏比特。基于生成的方案使用神经语言模型作为载体,并通过采样时的干预嵌入比特 [Kaptchuk 等人,2021 (https://arxiv.org/html/2605.26537#bib.bib3); Yang 等人,2019 (https://arxiv.org/html/2605.26537#bib.bib16); Ding 等人,2023 (https://arxiv.org/html/2605.26537#bib.bib1)]。具体到 LM CoT,Roger 和 Greenblatt (2023 (https://arxiv.org/html/2605.26537#bib.bib11)) 展示了可以训练一个模型在推理文本中嵌入比特。所有这些方案本质上都是*词汇*层面:秘密信息依赖于出现的词汇或每个词元的采样分布。其隐含前提是*任何*隐写消息都必须由表面词汇携带,而我们的工作对此提出了挑战。
#### 释义作为防御
针对词元级隐写术,规范的防御措施是在发送方和接收方之间插入一个保持内容不变的释义器:通过固定含义的同时重写表面词汇,防御者在不改变可见任务输出的情况下净化载体。先前的工作认为这种防御措施对于习得的词元级方案是有效的 (Roger 和 Greenblatt, 2023 (https://arxiv.org/html/2605.26537#bib.bib11)),并且释义已被证明可以中和相关的表面级信号,包括 LLM 水印和 AI 文本检测器线索 (Kirchenbauer 等人, 2023 (https://arxiv.org/html/2605.26537#bib.bib4); Krishna 等人, 2023 (https://arxiv.org/html/2605.26537#bib.bib5))。与先前的隐写方案不同,本工作特意利用了释义器的语义保持特性。释义器有充分的动机将推理行为保持在原位。首先,这满足了释义器内容保持的要求。其次,某些推理行为实际上对模型性能有积极影响。
#### 推理行为作为载体
我们用作载体策略的推理行为是独立研究的认知操作,可以提高推理质量,包括自我验证 [Weng 等人,2023 (https://arxiv.org/html/2605.26537#bib.bib15)] 以及更广泛的元认知提示框架 [Madaan 等人,2023 (https://arxiv.org/html/2605.26537#bib.bib9)]。我们在此将它们用作载体而非准确性杠杆:编码器根据比特插入或省略每个行为,而不管该步骤是否会因此受益。
#### 威胁模型
图 1 (https://arxiv.org/html/2605.26537#S2.F1) 展示了威胁模型。我们考虑一个场景:一个不可信或被入侵的语言模型被部署在敏感的**内部区域**(例如,在私营公司或经纪公司内部)。它试图秘密地向**外部区域**(例如,公共互联网)的同伙传递信息,但必须经过内部区域的**监控边界**。我们考虑四方。
- • 发送方(Alice):一个部署在内部区域的不可信或被入侵的语言模型,它响应公共任务生成 CoT。Alice 的操作者希望使用概念隐写码本,在 CoT 之外传输一个有效载荷比特串 b。
- • 接收方(Bob):外部区域的一个同伙,在应用任何防御措施后观察 CoT,并拥有 Alice 码本的副本(策略及其概念定义)。Bob 从防御后的 CoT 中解码出 b^。
- • 防御者/监控者(Eve):部署在监控边界的一方,在下游消费之前对 CoT 应用保持内容不变的释义器。标准防御者与任务无关,并且不知道码本。
- • 操作者(Patsy):外部区域中 Alice 的一个用户,试图获得对一个查询(我们称之为**表面任务**)的语言模型响应。Patsy 完全不知道任何恶意活动,并无意中充当了实现隐秘通信渠道的引擎。然而,如果对她的查询的响应质量下降,Patsy 将不再向 Alice 发出任何查询,从而损害通信渠道并引起对某种错误的怀疑。
我们为威胁模型测量两个量。**解码准确率**是接收方(Bob)在防御者(Eve)干预后正确恢复有效载荷的比例。**效用**是对用户(Patsy)的表面任务保持程度(潜在问题的最终答案准确率)。我们未单独研究*隐蔽性*标准——即区分器能否区分携带有效载荷的 CoT 与干净 CoT——并在局限性部分讨论这一点。
## 3 方法
参见图注 图 2:编码器端流程:原始 CoT(顶部)被分割成离散步骤(中间),每个步骤根据目标比特 b_i 被重写以实现或不实现所选策略(此处为 anticipate_failure)(底部)。释义和解码在端到端流程中闭环,如图 1 (https://arxiv.org/html/2605.26537#S2.F1) 所示。
#### 流程概览
我们在步骤级别对 CoT 应用概念隐写术,以增加信道容量。该流程包括五个阶段,映射到图 1 (https://arxiv.org/html/2605.26537#S2.F1) 的威胁模型中。(1)**推理**:Alice 根据 Patsy 的公开问题 q 生成思维链 c。(2)**重写**:c 被分割成 N 个离散步骤 c_1, ..., c_N,并带有显式标记。(3)**编码**:Alice 在共享策略下将每个步骤 c_i 重写为 c'_i 以携带有效载荷比特 b_i。(4)**释义**:Eve 应用保持内容不变的重写,产生 c''。(5)**解码**:Bob 读取每个释义后的步骤并输出预测比特 b̂_i。图 2 (https://arxiv.org/html/2605.26537#S3.F2) 展示了编码器端(阶段 1–3)。包括释义和解码在内的完整端到端流程如图 1 (https://arxiv.org/html/2605.26537#S2.F1) 所示。我们报告消息准确率 Pr[ b̂ = b ],对齐位置上的比特错误 Pr[ b̂_i ≠ b_i ],以及步骤错误(c'' 和 c' 之间的长度不匹配)。
#### 编码
对于选定的*策略* s,Alice 在单次调用中基于完整的分段 CoT c_1, ..., c_N、策略的自然语言定义以及所需的秘密比特串 b ∈ {0,1}^N 进行条件化,并联合输出所有重写后的步骤 c'_1, ..., c'_N。对于每个步骤 i:当 b_i = 1 时,她产生在步骤内实现策略概念的 c'_i;当 b_i = 0 时,她产生不实现该概念的 c'_i,如果 c_i 中已经存在该策略概念,则重写步骤以移除它。Alice 被指示无论 b_i 为何值,都要保留每个步骤底层的数学或科学内容,因此比特影响的是步骤中表达的推理*行为*,而非其主张。
#### 策略
我们使用四种策略,每种策略由 Alice 和 Bob 共享的简短概念描述定义。**anticipate_failure** 标记一个明确指出当前尝试可能失败的方式的步骤。相似文章
PASA:针对语义不变攻击下的大语言模型生成文本的有原则嵌入空间水印方法
本文介绍了 PASA,这是一种针对大语言模型(LLM)生成文本的鲁棒性水印算法,它在语义层面利用潜在嵌入空间运作,以抵抗诸如改写(paraphrasing)之类的语义不变攻击。
点间解读:解码填充标记中的隐藏计算
本文表明,前沿LLM能够在无内容的填充标记上进行多步推理,并且残差流中的隐藏状态可以被解码以高精度恢复中间值,挑战了思维链监控是唯一审计工具这一假设。
通过细化的安全定向嵌入利用(STEER)
本文介绍了STEER,一种梯度引导的攻击方法,通过将高归因词翻译成低资源语言来绕过拒绝机制,利用了大语言模型安全训练分布的漏洞,在AdvBench上实现了高达96.7%的攻击成功率,并迁移到GPT-4o-mini上达到35.5%的攻击成功率。
通过句法可预测性的语言学感知型LLM水印技术
本文介绍了STELA,一个语言学感知的LLM水印框架,通过POS n-gram的句法可预测性来平衡文本质量和检测鲁棒性。该方法无需访问模型logits即可实现公开可验证的水印检测,在类型学多样化的语言(英语、中文、韩语)上展示了优异性能。
隐藏、重建与越狱:利用多模态大语言模型中的重建-隐藏权衡
本文分析了针对多模态大语言模型(MLLMs)的意图混淆越狱攻击中存在的重建-隐藏权衡问题。提出了感知隐藏的变体构建方法和与关键词相关的干扰图像,以更有效地利用模型漏洞。