更深并不总是更好:通过置信层解码缓解对齐损失
摘要
本文介绍了一种无需训练的编码策略——Confident Decoding,它利用熵引导搜索动态选择LLM中最可靠的中间层,从而缓解对齐损失,并在GPQA-Diamond、Omni-MATH等基准测试中提升了推理性能,且开销可忽略不计。
查看缓存全文
缓存时间: 2026/06/23 09:41
论文页面 - 更深并非总是更好:通过置信层解码缓解对齐损失
来源:https://huggingface.co/papers/2606.21906 作者:
,
,
,
,
,
,
,
,
,
摘要
大语言模型中的自回归生成传统上使用最后一层进行 token 预测,但一种新的解码策略基于熵引导的保守反向搜索,动态选择更可靠的中间层,以最小的计算开销提升推理性能。
大语言模型(https://huggingface.co/papers?q=large%20language%20models)(LLMs)中的自回归生成(https://huggingface.co/papers?q=Autoregressive%20generation)通常从最后一层解码,假设更深层的表示能产生更可靠的下一 token 预测(https://huggingface.co/papers?q=next-token%20predictions)。我们重新审视了这一假设,揭示了反复出现的“猜测-修正-扰动”动态(https://huggingface.co/papers?q=Guess-Refine-Perturb%20dynamic):早期层形成粗略猜测,中间层修正与推理相关的语义,而最后几层则可能将这些修正后的预测扰动为泛化的或对齐偏好的 token。我们引入了置信解码(https://huggingface.co/papers?q=Confident%20Decoding),这是一种无需训练的解码策略,通过基于熵的保守反向搜索(https://huggingface.co/papers?q=entropy-guided%20conservative%20backward%20search)动态选择最可靠的接近最后一层。我们进一步将层选择(https://huggingface.co/papers?q=layer%20selection)形式化为最优停止问题(https://huggingface.co/papers?q=optimal%20stopping%20problem),证明在有界投影噪声(https://huggingface.co/papers?q=projection%20noise)和占主导地位的后期对齐扰动(https://huggingface.co/papers?q=alignment%20perturbation)条件下,我们的搜索规则能过滤扰动,同时将相对于最优修正层的损失控制在有界范围内。在密集型和混合专家 LLMs 上的实验表明,在具有挑战性的推理基准测试(https://huggingface.co/papers?q=reasoning%20benchmarks)中,包括 GPQA-Diamond(https://huggingface.co/papers?q=GPQA-Diamond)、Omni-MATH(https://huggingface.co/papers?q=Omni-MATH)和 HLE(https://huggingface.co/papers?q=HLE),该策略持续取得收益,且零内存开销、延迟增加不到 2%。这些结果表明,动态绕过最后一层的扰动可以释放对齐 LLM 中更强的推理能力。
查看 arXiv 页面(https://arxiv.org/abs/2606.21906)查看 PDF(https://arxiv.org/pdf/2606.21906)项目页面(https://arxiv.org/pdf/2606.21906)GitHub2(https://github.com/QwenLM/Confident-Decoding)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.21906)
在您的 agent 中获取这篇论文:
hf papers read 2606\.21906
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.21906 以从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.21906 以从此页面链接。
引用该论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.21906 以从此页面链接。
包含该论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从此页面链接。
相似文章
缓解流形偏离:面向可信MLLM解码的不确定性感知子空间矫正
本文介绍了MGAP,一种无需训练的解码方法,通过自适应地仅抑制语言先验中的有害部分,同时保留模型的语义流形,从而减少多模态大语言模型中的幻觉。该方法在POPE和CHAIR基准测试上优于先前的基线方法。
Dominant-Layer ZO:单一层主导LLMs的零阶微调
本文揭示了LLM的零阶微调主要由单个解码层主导,该层可通过激活异常值识别,并且仅微调该层即可达到或超越全模型微调的效果,同时带来高达4.52倍的加速。
面向鲁棒即插即用适配的解耦对齐
介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。
注意力引导的大语言模型对比解码层选择策略
提出了三种注意力引导的大语言模型对比解码层选择策略,在TruthfulQA上相比DoLa基线提高了事实准确性。
浅层预填,深层解码:通过层非对称 KV 可见性实现高效的长上下文推理
本文介绍了 SPEED,一种层非对称 KV 可见性策略,通过仅在预填阶段的下层处理提示 token,同时在解码阶段保持全深度注意力,从而降低长上下文推理的成本。