更深并不总是更好:通过置信层解码缓解对齐损失

Hugging Face Daily Papers 论文

摘要

本文介绍了一种无需训练的编码策略——Confident Decoding,它利用熵引导搜索动态选择LLM中最可靠的中间层,从而缓解对齐损失,并在GPQA-Diamond、Omni-MATH等基准测试中提升了推理性能,且开销可忽略不计。

大型语言模型(LLM)中的自回归生成通常从最后一层进行解码,假设更深的表示能产生更可靠的下一词预测。我们通过揭示一种反复出现的“猜测-优化-扰动”动态来重新审视这一假设:早期层形成粗略猜测,中间层优化与推理相关的语义,而最终层可能将这些优化后的预测扰动为通用或对齐偏好的词元。我们引入了Confident Decoding,这是一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层。我们进一步将层选择理论化为一个最优停止问题,表明在有限投影噪声和主导的后期对齐扰动下,我们的搜索规则在过滤扰动的同时,相对于最优优化层限定了损失。在密集型和混合专家LLM上的实验表明,在包括GPQA-Diamond、Omni-MATH和HLE等具有挑战性的推理基准测试上取得了持续改进,内存开销为零,延迟增加不到2%。这些结果表明,动态绕过最终层的扰动可以解锁对齐LLM更强的推理行为。
查看原文
查看缓存全文

缓存时间: 2026/06/23 09:41

论文页面 - 更深并非总是更好:通过置信层解码缓解对齐损失

来源:https://huggingface.co/papers/2606.21906 作者:

,

,

,

,

,

,

,

,

,

摘要

大语言模型中的自回归生成传统上使用最后一层进行 token 预测,但一种新的解码策略基于熵引导的保守反向搜索,动态选择更可靠的中间层,以最小的计算开销提升推理性能。

大语言模型(https://huggingface.co/papers?q=large%20language%20models)(LLMs)中的自回归生成(https://huggingface.co/papers?q=Autoregressive%20generation)通常从最后一层解码,假设更深层的表示能产生更可靠的下一 token 预测(https://huggingface.co/papers?q=next-token%20predictions)。我们重新审视了这一假设,揭示了反复出现的“猜测-修正-扰动”动态(https://huggingface.co/papers?q=Guess-Refine-Perturb%20dynamic):早期层形成粗略猜测,中间层修正与推理相关的语义,而最后几层则可能将这些修正后的预测扰动为泛化的或对齐偏好的 token。我们引入了置信解码(https://huggingface.co/papers?q=Confident%20Decoding),这是一种无需训练的解码策略,通过基于熵的保守反向搜索(https://huggingface.co/papers?q=entropy-guided%20conservative%20backward%20search)动态选择最可靠的接近最后一层。我们进一步将层选择(https://huggingface.co/papers?q=layer%20selection)形式化为最优停止问题(https://huggingface.co/papers?q=optimal%20stopping%20problem),证明在有界投影噪声(https://huggingface.co/papers?q=projection%20noise)和占主导地位的后期对齐扰动(https://huggingface.co/papers?q=alignment%20perturbation)条件下,我们的搜索规则能过滤扰动,同时将相对于最优修正层的损失控制在有界范围内。在密集型和混合专家 LLMs 上的实验表明,在具有挑战性的推理基准测试(https://huggingface.co/papers?q=reasoning%20benchmarks)中,包括 GPQA-Diamond(https://huggingface.co/papers?q=GPQA-Diamond)、Omni-MATH(https://huggingface.co/papers?q=Omni-MATH)和 HLE(https://huggingface.co/papers?q=HLE),该策略持续取得收益,且零内存开销、延迟增加不到 2%。这些结果表明,动态绕过最后一层的扰动可以释放对齐 LLM 中更强的推理能力。

查看 arXiv 页面(https://arxiv.org/abs/2606.21906)查看 PDF(https://arxiv.org/pdf/2606.21906)项目页面(https://arxiv.org/pdf/2606.21906)GitHub2(https://github.com/QwenLM/Confident-Decoding)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.21906)

在您的 agent 中获取这篇论文:

hf papers read 2606\.21906

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.21906 以从此页面链接。

引用该论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.21906 以从此页面链接。

引用该论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.21906 以从此页面链接。

包含该论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从此页面链接。

相似文章

Dominant-Layer ZO:单一层主导LLMs的零阶微调

arXiv cs.LG

本文揭示了LLM的零阶微调主要由单个解码层主导,该层可通过激活异常值识别,并且仅微调该层即可达到或超越全模型微调的效果,同时带来高达4.52倍的加速。

面向鲁棒即插即用适配的解耦对齐

arXiv cs.CL

介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。