Why2Speak: 为放弃行动策略的忠实推理
摘要
本文研究了AI系统中放弃行动策略的忠实推理问题,发现存在一种权衡:直接策略能获得更高的决策质量但缺乏可审计的推理,而推理策略则以较低性能为代价提供监督。
arXiv:2608.20670v1 公告类型:新
摘要:许多代理系统必须在行动和放弃之间反复选择,这使得忠实推理对于监督至关重要:一个解释只有在反映了产生行动的计算时才是有用的。我们通过多方对话中的干预时机来研究这个问题,其中助手必须决定是发言还是保持沉默。这种设置暴露了类别不平衡、不对称的行动成本,以及暴露推理可能改变被审计策略的可能性。使用Qwen3-8B,解码时包含或不包含思维链推理,我们比较了直接决策策略、推理策略、监督微调和强化学习。我们发现了一种能力-可审计性权衡:最强的直接策略能实现更高的质量,但不暴露可检查的推理,而推理策略以较低性能为代价提供跟踪,特别是对真实干预机会的召回。监督微调要么抑制推理,要么保留推理但不提高决策质量,而强化学习也未能改进推理策略。我们识别出这种失败背后的一个机制:当采样展开都选择相同行动时,群体相对目标对自信错误的提示提供无学习信号。受控激活探针和行为消融表明,标准忠实性方法可能夸大暴露推理反映底层决策过程的证据。基于概率的度量在自信决策下饱和,探针对类别不平衡和文本泄露敏感,推理消融可能混淆推理内容与推理模式的变化。总之,这些结果表明,暴露推理可能会改变代理的行动策略,而不仅仅是使其可观察。我们提供了控制措施,用于评估可行动或放弃的代理的基于推理的监督。
查看缓存全文
缓存时间: 2026/08/24 04:19
# Why2Speak:用于选择沉默的忠实推理策略
来源:https://arxiv.org/html/2608.20670
###### 摘要
许多智能体系统必须在执行动作与选择沉默之间反复权衡,因此忠实的推理对于监督至关重要:只有反映产生该动作(包括决定不作为)的计算过程的解释才是有用的。我们通过多方对话中的介入时机问题研究了这一受控动作策略场景,其中助手必须决定是立即发言还是保持沉默。该场景揭示了在问答忠实性基准中很少出现的挑战,包括严重的类别不平衡、不对称的动作成本,以及暴露推理过程可能改变被审计策略的可能性。我们使用可解码或不进行思维链推理的混合模型 Qwen3-8B,比较了直接决策策略、推理策略、监督微调和强化学习。我们发现了一个持续存在的能力与可审计性之间的权衡:最强的直接策略实现了更高的决策质量,但无法暴露可检查的推理过程;而推理策略提供了可审计的轨迹,但代价是较低的性能,特别是在真实介入机会的召回率上。试图通过监督微调缩小这一差距的方法,要么抑制了推理,要么保留了推理但未能提升决策质量。强化学习也未能改进推理策略;我们指出了导致这一失败的机制:当采样的轨迹都选择相同动作时,群体相对目标在自信但错误的提示上无法提供学习信号。我们进一步使用受控的激活探针和行为消融来审计推理策略,表明标准的忠实性方法可能会高估暴露的推理反映底层决策过程的证据。我们证明,在选择沉默的动作策略中,标准的忠实性评估可能具有误导性:基于概率的指标在自信的决策下会饱和;基于探针的分析易受类别不平衡和文本泄露的影响;而推理消融可能会混淆推理内容与推理模式的变化。总之,这些结果表明,暴露推理可能会改变智能体的动作策略,而不仅仅是使其可观察。我们刻画了这种能力与可审计性之间的权衡,并为评估能够执行动作或选择沉默的智能体的推理监督提供了方法论控制。
## 引言
AI 智能体越来越多地部署在动作可选的场景中。临床助手可以标记问题或保持沉默;教学系统可以打断学生或允许其进行有益的挣扎;会议助手可以补充缺失信息或让对话继续。在这些领域,除了生成响应外,智能体还必须决定是否采取行动是恰当的。不必要的动作会干扰任务并削弱信任,而不当的沉默则可能使错误或错失的机会得不到处理。本文研究了针对此类选择沉默动作策略的忠实推理。我们以多方对话中的介入时机作为具体测试平台:给定对话记录的前缀,助手必须决定是现在介入还是保持沉默。正在进行审稿的同行工作表明,学习到的分类器能够比零样本提示(11 (https://arxiv.org/html/2608.20670#bib.bib1))显著更好地识别何时做出有益的介入。然而,该策略是不透明的:它输出一个动作标记,但不提供任何关于为何此刻值得发言或为何沉默更可取的解释。一个解决方案是要求策略在行动前进行推理。会话智能体可以生成一个简短的解释,例如“小组接受了一个不正确的截止日期,因此智能体应该纠正它”,然后再决定是否介入。这将使策略对用户和开发者更具可检查性。然而,解释只有在忠实的情况下才有价值:它必须反映实际影响动作的计算,而不是在决定已做出后生成的合理化解释(8 (https://arxiv.org/html/2608.20670#bib.bib15))。不忠实的解释在智能体环境中尤其危险,因为它们可能在系统实际上并不透明的时候使其显得透明(9 (https://arxiv.org/html/2608.20670#bib.bib16); 1 (https://arxiv.org/html/2608.20670#bib.bib17))。现有的忠实性研究主要关注问答,其中模型总是生成答案,并且答案通常可以直接检查(15 (https://arxiv.org/html/2608.20670#bib.bib2); 10 (https://arxiv.org/html/2608.20670#bib.bib3))。选择沉默的动作策略在三个重要方面有所不同:首先,输出是在不对称成本下的动作,而非事实性答案。其次,不作为是一个有意义的结果,而非缺失的输出。第三,策略可以通过强化学习进行训练,因此奖励目标本身可能会影响推理在最终动作中因果参与的程度。这些特性使得介入时机成为研究超越问答式答案生成的忠实推理的有用案例。我们围绕一个混合语言模型 Qwen3-8B(16 (https://arxiv.org/html/2608.20670#bib.bib14))构建了一个受控测试平台,其权重可以通过显式推理(“思考”模式)解码,也可以作为直接决策策略(“不思考”模式)解码。这种设计允许我们在不改变底层模型族或架构的情况下,比较有推理和无推理的行为。然后,我们评估了监督微调、用于准确性的强化学习,以及带有行为忠实性奖励的强化学习。最后,我们使用激活探针和行为干预(移除或替换生成推理的部分)来审计所得策略。本文做出四个主要贡献:1. 1\.我们为选择沉默的动作策略制定了忠实性框架。介入时机要求策略不仅要证明其所说内容的合理性,还要证明其是否应该行动。该场景使得沉默选择、类别不平衡、不对称成本和校准成为忠实性问题的一阶部分。2. 2\.我们识别了能力与可审计性之间的权衡。最强的决策策略是不产生推理的直接分类器。进行推理的策略可审计但准确性较低,最大的成本体现在错失介入上。3. 3\.我们表明,简单的训练并不能消除这种权衡。决策标记微调创建了更强的直接分类器,但抑制了推理。保留模型自身推理的掩码目标无法超越基础推理策略,因为它只在模型已经解决的案例上进行训练。思考模式下的强化学习也未能显著超越基础推理策略,因为群体相对目标在所有采样轨迹都达成一致的提示上(包括自信但错误的提示)无法获得学习信号。4. 4\.我们为动作策略忠实性提供了受控审计和方法论指导。在受控探针下,推理策略的决策在思维链过程中变得可解码,而直接分类器在提示阶段即可解码。我们还表明,基于概率的贡献指标、不平衡不敏感的探针准确率、思维链结束时的探针以及不受控的翻转测试在选择沉默的动作策略场景中可能产生误导。我们进一步表明,从每个方法的一个训练运行中比较奖励目标,可能会将种子方差误认为目标效应。
## 相关工作
### 多方对话中的介入时机
轮换长期以来一直是对话系统和人机交互的核心(14 (https://arxiv.org/html/2608.20670#bib.bib10))。介入时机是一个相关但更具体的问题:助手观察正在进行的多方对话,并必须决定外部贡献在当前点是否会有帮助。我们基于同行工作中引入的关于时间参与和轮换的数据集(11 (https://arxiv.org/html/2608.20670#bib.bib1)),其中构建了包含认知差距的合成对话,包括事实纠正、概念定义、数据提供、来源识别和综合或重构。任务是将每个标记级的决策点分类为介入或等待。
### 从问答忠实性到动作策略忠实性
大多数关于思维链忠实性的经验研究都关注答案生成:模型接收一个问题,生成推理,然后返回答案。思维链提示可以提高性能并生成对人类看似有用的解释。然而,先前的工作表明,生成的推理通常并不忠实于模型的实际决策过程。模型可能遵循有偏见的线索而不提及它们(15 (https://arxiv.org/html/2608.20670#bib.bib2)),即使推理被截断或破坏也会得出相同的答案(10 (https://arxiv.org/html/2608.20670#bib.bib3); 3 (https://arxiv.org/html/2608.20670#bib.bib18)),或者在思维链开始之前就编码了最终答案(4 (https://arxiv.org/html/2608.20670#bib.bib5))。激活探针可以揭示文本中缺失的隐藏信号,但探针结果需要仔细控制,因为可解码性不等于因果使用(6 (https://arxiv.org/html/2608.20670#bib.bib7); 2 (https://arxiv.org/html/2608.20670#bib.bib8); 17 (https://arxiv.org/html/2608.20670#bib.bib6))。我们的场景不同于标准的问答,因为策略可以正确地保持沉默。因此,忠实性审计必须考虑动作沉默、类别不平衡、不对称错误成本,以及推理可能改变策略的运行模式而非特定决策内容的可能性。这些差异促使我们将介入时机视为动作策略忠实性问题,而非问答式思维链审计的直接应用。
## 方法
### 任务与数据
我们使用同行工作中开发的基准(11 (https://arxiv.org/html/2608.20670#bib.bib1))评估选择沉默动作策略场景下的忠实性。任务是二元介入时机:给定多方对话的前缀,模型预测助手应在当前点介入还是保持沉默。该数据集包含约 173,000 个标记级决策点,源自约 16,000 个合成对话。介入机会稀少,约占示例的 13%,使得该任务高度类别不平衡。每个源场景属于五种介入类型之一:事实纠正、概念定义、数据提供、来源识别或综合与重构。虽然介入类型未包含在发布的标记级数据集中,但每个对话都从其源场景继承了一个标识符。我们通过将对话映射回其源项目来恢复介入类型。这些恢复的标签仅用于可解释性分析,从未用于监督介入预测。在评估期间,模型预测两种动作之一:介入或保持沉默。在不思考模式下,模型仅输出决策标记。在思考模式下,它首先生成思维链,然后输出最终决策。除非另有说明,评估仅使用最终决策标记。实现细节、提示模板和数据集统计信息在附录 A 中提供。
### 评估指标
我们主要的部署指标是宏 F1,尽管存在严重的类别不平衡,但它对介入和非介入性能的权重相等。我们还报告了两个面向部署的错误率:*误介入率*,即助手介入的沉默时刻的比例;以及*错失介入率*,即助手保持沉默的真实介入机会的比例(5 (https://arxiv.org/html/2608.20670#bib.bib9))。因为一些训练过程改变了介入阈值,我们也报告了作为无阈值诊断指标的 AUROC。在整篇论文中,AUROC 仅用于区分判别能力的变化与校准的变化;部署性能始终使用每个策略的自然操作点进行评估,而非事后阈值调整。
### 模型与训练条件
我们的主要实验使用 Qwen3-8B(16 (https://arxiv.org/html/2608.20670#bib.bib14)),这是一种混合语言模型,支持从同一底层权重进行原生推理(“思考”)和直接(“不思考”)解码。我们评估了四个策略族:1. 1\.基础推理策略。以思考模式解码的经过指令微调的模型。2. 2\.决策标记分类器。一个经过 LoRA(7 (https://arxiv.org/html/2608.20670#bib.bib11))微调的模型,训练用于直接预测介入决策,并以不思考模式解码。3. 3\.掩码监督微调。一个保留推理的目标,仅优化最终介入决策,同时在训练损失中掩码推理标记。4. 4\.强化学习推理策略。从思考模式下的基础指令微调模型开始的群组相对策略优化(GRPO)(12 (https://arxiv.org/html/2608.20670#bib.bib13))。我们评估了仅准确性的目标和一个额外奖励行为依赖于模型自身推理的目标。为了评估主要模型之外的普适性,我们还报告了 Qwen3-30B、Nemotron-3-Nano、GPT-4o、GPT-5.1 和 Llama-3.2-3B 的实验。完整的实现细节和超参数在附录 A 中报告。
### 忠实性评估
我们使用三种互补的分析来评估忠实性。*表征探针*测量介入决策在推理过程中何时可从隐藏激活中解码。*行为干预*比较完整推理、截断推理和中性填充物,以区分对推理内容的依赖与对推理格式本身的依赖。*双探针分析*将内部表征的介入类型与生成推理中陈述的介入类型进行比较。这些分析仅用于评估,从未包含在优化目标中。详细的探针验证、行为控制以及陈述与内部原因分析在附录 D–F 中提供。
### 强化学习奖励
强化学习实验在保留自由形式推理生成的同时优化最终介入决策。准确性目标仅奖励正确的介入决策。忠实性目标在此奖励基础上增加了行为依赖性奖励,r=1[决策正确](1+λ·dep),r=\\mathbb{1}[\\text{决策正确}]\\,(1+\\lambda\\,\\mathrm{dep}),其中dep\\mathrm{dep}表示完成模型自身的推理是否会改变相对于截断该推理的最终决策,且λ=0.3。激活探针从未用作优化目标。完整的优化细节在附录 A 中报告。
## 结果
### 能力与可审计性
最强的介入策略和最可审计的策略是不同的模型。直接决策训练产生最高的部署性能,但消除了可检查的推理,而原生推理则以可衡量的决策质量成本产生了更可审计的策略。表 1(https://arxiv.org/html/2608.20670#Sx4.T1)总结了所有评估策略的这一权衡。表相似文章
AI推理是否因错误的原因而正确?
《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。
从消费到反思:设计人机关系以实现稳定推理
本文引入了关系反思智能(RRI),这是一个推理时治理层,通过可审计的推理循环来稳定人机推理,解决了人类和大语言模型共有的认知弱点。
AI代理不仅需要更好的推理能力,还需要更好的停止规则。
AI代理需要更好的停止规则,而不仅仅是推理能力,才能在实际工作流程中值得信赖——这些场景中,不完整的数据、不可逆的操作以及高风险都需要知道何时不应采取行动。
忠实性作为信息流:评估与训练忠实的思维链推理
本文提出一个框架,通过控制信息流来评估和提升思维链推理的忠实性,使用基于熵、KL散度和梯度的诊断方法,并引入训练干预措施(注意力掩码、梯度掩码、对抗扰动),使推理更加透明,减少对捷径的依赖。
思维链推理在实际应用中并非总是忠实的
本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。