一次通过:在冻结语言模型的单次前向传递中同时进行回答与拒绝

arXiv cs.CL 论文

摘要

本文介绍了YOPO方法,该方法在冻结语言模型的单次前向传递中结合了引导探针和充分性方向,以提高推理准确性,并在信息不足时实现拒绝,展示了在各种基准和模型规模上的改进。

arXiv:2608.14465v1 公告类型:新 摘要:冻结的语言模型在推理任务上有两个耦合的弱点:它未能充分利用自身残差流中已编码的证据,并且当输入不足以回答时无法检测,从而导致幻觉。本文整合了两条研究路线,以解决同一残差流上的这些问题:一个条件引导探针在中间层写入残差流,从冻结的骨干网络恢复推理准确性;一个零样本充分性方向读取残差流,并在信息不足时拒绝回答。在单次前向传递中部署时,它们相互干扰:引导写入改变了状态,使得方向读取受影响,在小模型上导致跨域转移的AUROC分数损失高达8点;单独的干净传递则使推理成本翻倍。我们保持方向固定,并训练一个小网络从引导后的残差重构预引导残差——使用(引导后,干净)对的均方误差,无充分性标签——并在重构上读取方向。由此产生的系统YOPO(You Only Pass Once),在冻结的Qwen2.5骨干网络(1.5B/3B/7B)的单次前向传递中实现回答、引导和拒绝。端到端,三重准确率比冻结基线翻倍以上(1.5B alphaNLI上从0.375提升到0.798),且单次传递在每个规模上都优于双次传递参考(0.798/0.830/0.893 vs 0.753/0.790/0.863),并在六个模型家族的十个骨干网络上表现更优。我们绘制了容量-转移前沿,量化了拒绝不应被训练的原则;源端审计发现我们自己的alphaNLI构建泄露了表面伪影,因此架构主张基于原生标签复现(SQuAD2, RepLiQA, MuSiQue);在我们贡献的标准四领域套件上,据我们所知,这是第一个回答或拒绝基准,其中我们的门控在每个域内数据集上表现最佳,且无标签方向是唯一能够在域间转移中存活的门控家族。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:59

# 在冻结语言模型的单次前向传播中同时实现回答与弃权  
来源:https://arxiv.org/html/2608.14465  
作者:钟尧 (Zhongyao Chu, [email protected])、谢欣杰 (Xinjie He, [email protected])、王耀霆 (Youting Wang, [email protected])、秦旭辉 (Xukui Qin, [email protected])、吴润雄 (Runxiong Wu, [email protected])、陈彦璇 (Yan-Syuan Chen, [email protected])  

###### 摘要  
冻结语言模型在推理任务上存在两个耦合弱点:它未能充分利用自身残差流中已编码的证据,并且无法检测输入何时不足以回答问题,从而导致虚构回答。本文整合了两条由不同作者团队分别开发的研究路径——此处作为统一系统进行报告——二者针对同一残差流进行优化:一个条件性*转向探针**写入*残差流的中部层,从而从冻结的骨干网络中恢复推理准确性;另一个零样本*充分性方向* *d*Mathbf{d}**读取*残差流,并在信息不足时选择弃权。我们在单次前向传播中同时部署这两种机制,并研究它们之间的相互干扰。转向写入会改变*d*Mathbf{d}所读取的残差状态:在小模型上,单次通过门控损失了高达88个AUROC点的跨域迁移能力,而读取单独的干净传播则使推理成本翻倍。我们保持*d*Mathbf{d}**固定**,并训练一个小网络从转向后的残差重构转向前的残差——基于(转向后,干净)残差对的均方误差,无需收集任何充分性标签——然后在重构结果上重新应用*d*Mathbf{d}。由于训练过程从未见过充分性标签,该修正机制继承了该方向的跨任务稳定性。由此产生的系统YOPO(You Only Pass Once)能够通过冻结的Qwen2.5骨干网络(1.5B/3B/7B)的单次前向传播完成回答、转向和弃权。修正后的单次传播恢复了双次传播的大部分上限性能:在1.5B模型上,迁移AUROC从0.836提升至0.888(上限为0.918),域内性能从0.913提升至0.959。在修正机制上叠加一个监督门控——我们的*旗舰方案*——在所有规模下均取得单次传播的最高分数(域内:0.982/0.984/0.997,高于双次传播上限;迁移性能在3B/7B模型上与上限相差不超过0.006/0.003),其迁移成本经过量化而非隐藏;而纯无标签修正机制在1.5B模型上仍是迁移安全的选择(0.888 vs. 0.859)。整体而言,三路准确率较冻结基线提升了一倍以上(在1.5B αNLI任务上:0.375→0.798),超过单独使用任一组件(转向仅用:0.590;门控仅用:0.560),并且单次传播系统在所有规模下均优于双次传播参考系统(0.798/0.830/0.893 vs. 0.753/0.790/0.863),并在六个模型家族的十个骨干网络上均取得优势(10/10)。我们绘制了完整的容量-迁移边界,为“弃权不应通过训练引入”这一设计原则提供了量化依据;干扰现象集中在小模型上,并在7B模型上*反转*——此时转向后的读取已是更好的基础(域内性能0.995 vs. 0.985),而恒等初始化的修正机制学会不执行任何操作。通过源侧审计——早期层可分离性作为捷径信号——我们发现自身的αNLI构造存在表面伪影泄漏,因此将所有架构主张基于原生标签复现任务(SQuAD2、RepLiQA、MuSiQue)进行验证。在我们贡献的标准四域套件上(据我们所知是首个),我们建立了回答-或-弃权(混合)基准,并在两个维度上取得领先:我们的门控在所有域内数据集上均取得最高分;并且——在零目标标签下部署——它是唯一能在域迁移中存活的门控家族,基于最难源域(MuSiQue)训练的无标签方向在三个可迁移目标中的两个上匹配其自身监督式域内上限,而所有经训练的竞争者均退化至随机水平;二者可视为一个标签条件系统的两个操作点。思维链回答(其生成的草稿在结构上无法通过我们的前缀时间门控)将可回答的多跳问答性能提升五倍(在MuSiQue上:0.062→0.313)。

## 1 引言  
考虑一个被要求执行溯因推理的冻结语言模型:给定观测结果,选择更合理的解释(Bhagavatula et al. 2020)。两种主要失败模式占主导地位。首先,模型*未能充分利用已有信息*:其残差流已明确编码了从未到达答案逻辑层的证据,而轻量级推理时干预可以恢复这些信息。其次,模型*不知道何时信息不足*:当输入确实不足时,冻结模型仍会——自信地——给出答案,而非弃权。一个可部署的推理系统必须同时做到:*最大限度地提取*上下文所支持的信息,并在上下文无支持时*弃权*。这两种能力共享同一载体,本文整合了构建它们的两条研究路径——分别由不同作者团队开发,此处作为统一系统报告。我们的*转向路径*表明,一个小型*条件性转向探针*在冻结骨干网络的几个中部层*写入*残差流,可在Qwen2.5-1.5B上将溯因准确率提升高达+21.7个百分点,在最难的全精度7B任务上提升+4.96个百分点(精确McNemar检验p=1.7×10⁻⁷)。互补地,我们的*充分性路径*表明,一个*零样本均值差方向*d*Mathbf{d}**读取*残差流,能在远早于模型自身行为时检测到上下文不足——留出集的sel-AUROC在四个QA域上分别达到0.935/0.997/0.935/0.783,而这些域的零样本口头准确率仅为0.854/0.873/0.588/0.535;并且,在基于原生标签的三家族比较中(第10节),*迁移成本随写入访问权增加而增长*:跨域迁移使只读方向损失2.7个百分点,一个受限的激活写入器(采用与本文写入器相同设计的转向探针,在判断任务上训练)损失16.3个百分点,而一个自由权重写入器(LoRA)损失23.1个百分点;两个写入家族均落入目标域自身零样本基线*之下*——平均而言,部署训练过的判断器比什么都不部署更差——而仅靠方向本身即可平均带来+8.6个百分点的增益(在12个迁移场景中有9个成立;另见Lavi et al. 2025中监督分类器的跨域崩溃现象)。域内排序则相反——写入自由度占优(四场景平均:0.826→0.843→0.909,LoRA在全部四个场景中胜出)——因此该原则权衡的是*迁移*而非准确率,本文将该成本量化为容量与规模的函数。  

本文研究了任何实际部署都要求的场景:写入器与读取器*在同一次前向传播中*,因为为门控执行单独的干净传播会使推理成本翻倍。在此情况下,二者发生干扰——写入扰动了方向所读取的状态。其影响可测量:在Qwen2.5-1.5B上,将读取从干净传播移至转向传播,导致门控在域内从0.962降至0.913,在跨任务迁移中从0.918降至0.836。两个明显的修复方案均失败:干净传播以双倍成本恢复门控性能,而在转向状态上使用任务监督门控可恢复域内准确率,但需付出迁移代价,在小规模上尤为显著(在1.5B上比无标签修复低33–55个百分点)。更尖锐的问题是:*在必须引入任务监督(及其迁移成本)之前,单次转向传播能恢复多少读取性能?*我们的答案消除了*扰动*而非弃权。写入是所读残差的平滑函数,因此其影响可通过重构(转向后,干净)对来学习和消除,而这些配对无需标注;由于不携带充分性标签,修复后的读取保留了该方向的迁移能力。  

贡献。我们将两个组件路径作为首个在共享冻结网格上的主要结果进行报告,并添加了使其能协同部署的实践与基准:  
- (i) 转向写入器及其跨规模和数据集的完整注入几何基准(第7节);  
- (ii) 零样本充分性读取器,首次将其实用设计原则量化为融合设置中测得的容量-迁移边界(第6节);  
- (iii) 无标签修正机制,使两者共享单次前向传播,将端到端三路准确率较冻结基线提升一倍以上,同时匹配双次传播参考性能(第7节);  
- (iv) 三种单次传播融合架构(重构、带自抑制写入的只读、层排序)在共享注入模块上的受控同域比较,表明干扰的严重性依赖于协议(第10节);  
- (v) 据我们所知,在标准四域套件上的首个回答-或-弃权(混合)基准,其中监督门控在所有四个数据集上均领先域内性能,而基于最难源域训练的无标签方向在跨域迁移中表现最佳(第10节)。  

技术核心是项目(iii),一种残差流的无标签修正。我们保持零样本方向*d*Mathbf{d}**固定**——从不重新训练,以保留其来源和迁移能力——并学习一个小映射M去除转向扰动:M在简单MSE目标下从转向残差s重构干净充分性层残差。训练过程*不使用任何充分性标签*;(转向后,干净)配对通过设计免费获取(运行一次提取器,分别启用和禁用钩子),因此未学到任何关于弃权的任务特定信息。推理时,系统运行*一次*转向传播,读取s=d^⊤M(h_steer),当s低于百分位数阈值时弃权。转向保留了其推理增益,方向保留了其零样本迁移能力,且读取得到修复。我们得分最高的单次传播门控在此修正上叠加了一个小型监督提升(第5节);而下文的纯无标签映射既是使单次传播可行的机制,也是迁移安全的后备方案。具体而言,在冻结的Qwen2.5网格上,没有任何组件接近组合效果:在1.5B αNLI三路准确率上,冻结基线得分0.375,仅转向得0.590,仅门控得0.560,而融合的单次传播系统得0.798——在所有规模上优于双次传播参考系统(0.798/0.830/0.893 vs. 0.753/0.790/0.863),并在六个模型家族的十个骨干网络上均取得优势(第9节,10/10)。修正机制本身无标签且在其所需之处有效:在1.5B上,它将单次传播门控从0.913/0.836(域内/迁移AUROC)提升至0.944/0.888,恢复了63%的迁移污染。且污染遵循规模定律——干净与转向传播的迁移差距在1.5B/3B/7B上从0.082降至0.031再至0.013,并在7B上域内性能反转(转向后读取*优于*干净读取,0.995 vs. 0.985),此时恒等初始化映射正确学会不执行操作。因此,修正机制在冻结模型转向最具价值之处——小模型——最为重要,两项结果组合成受预算约束的方案(第12节)。  

提议配置。在严格的单次传播预算下,我们提议全容量门控——多层去污加BCE提升——该方案在所有规模下均取得单次传播的域内最高分(高于双次传播上限),并在3B和7B上取得最佳迁移性能。我们绘制的帕累托边界规范了此选择:任务特定容量以单调方式换取域内准确率并付出迁移成本——这是我们在融合设置中对充分性路径设计法则的量化确认——且该成本依赖于规模:在3B及以上可忽略,在1.5B则真实存在,此时无标签映射是迁移安全的后备方案(0.888 vs. 0.859),且我们构建的任何单次传播门控均无法超越双次干净传播的迁移性能(0.918)。我们报告此无上限违反的方案,同时列出失败的变体(第11节)。

## 2 相关工作  
**激活转向。** 将固定的对比方向添加到残差流(Turner et al. 2023; Panickssery et al. 2024),沿学习方向进行推理时平移(Li et al. 2023),表示工程(Zou et al. 2023),任务/函数向量(Todd et al. 2024; Ilharco et al. 2023),低秩子空间重写(Wu et al. 2024),以及条件门控固定向量(Lee et al. 2024)。我们的转向探针与之不同之处在于,使转向*方向本身*成为残差的输入条件函数;本文报告了该写入器跨规模的完整基准,并研究其与读取器的交互。  
**可回答性与充分性读取。** 模型线性编码(不)可回答性(Kadavath et al. 2022; Slobodkin et al. 2023);均值差方向可跨数据集迁移(Lavi et al. 2025)。我们的充分性路径建立了零样本充分性门控,通过零训练*中继转向*将其判断引入模型自身的口头回答(执行保真度在16/16单元格中为1.0000,第10节),并基于原生标签说明读取必须保持未训练:内部读取远早于模型的口头行为,而任何*训练*的判断都会吸收源域的特征,并在域偏移时按写入访问权比例付出代价——对于两个写入家族,均落入目标域自身零样本基线之下——这正是Lavi et al. 2025中监督分类器崩溃所预示的失败模式。融合的单次传播设置——通过活跃写入进行读取——是两条路径单独都未处理的,也是本文所增添的内容。  
**重构作为修复。** 我们的映射像去噪器一样训练(Vincent et al. 2008; Lehtinen et al. 2018):从扰动状态重构未扰动状态,扰动过程(此处为转向写入)提供免费的训练配对。与表示“修补”/编辑分析不同,此处的目标不是可解释性,而是保留下游的零样本读取;与监督探针不同,其目标不携带任务标签,这正是保留迁移能力的原因。

## 3 设置:残差流上的写入器与读取器  
**写入器:条件性转向探针(转向路径的贡献)。** 在冻结骨干网络的几个中部层l,一个小MLP读取残差r_{l,t}在五个分散提示位置的信息,并回写r' = r + a ∥r∥ u(r),其中u(r)是条件方向向量……

相似文章

Why2Speak: 为放弃行动策略的忠实推理

arXiv cs.AI

本文研究了AI系统中放弃行动策略的忠实推理问题,发现存在一种权衡:直接策略能获得更高的决策质量但缺乏可审计的推理,而推理策略则以较低性能为代价提供监督。