长度惩罚使思维链更难监控

arXiv cs.AI 论文

摘要

本文探讨了在思维链推理过程中应用长度惩罚如何降低监控推理过程的能力,从而引发了对可解释性和对齐的担忧。

arXiv:2607.09786v1 Announce Type: new Abstract: 长度惩罚的强化学习可以缩短思维链推理,同时隐藏驱动模型答案的影响因素。在我们的实验中,即使模型的思维链提及提示的频率大大降低,使用长度惩罚进行训练并不能阻止误导性提示引导模型。令牌精度评估会将这些运行视为成功,因为它们使用的推理令牌更少且精度损失很小;但它会忽略剩余的痕迹是否仍能显示是什么驱动了答案。我们训练了Qwen3-4B和Qwen3-14B模型变体,使用不同的目标思维链长度,然后在保留的MMLU-Pro-R和四个迁移基准上使用偏差提示干预进行评估。压缩大幅减少了推理令牌,保持了大部分多项选择的准确性,并使提示影响接近基线。在最强的目标下,Qwen3-14B的下限忠实度降至基线的63.1%,Qwen3-4B降至69.4%;监控器捕获提示使用的原始比率从69%下降到49%,以及从60%下降到48%。为了将长度与内容分开,我们从未压缩的基线链中随机删除句子,直到剩余文本与压缩后的长度匹配。即使在这种长度匹配之后,压缩链披露提示的频率仍比我们随机缩短的基线链低7-35个百分点,对于Qwen3的两种尺寸和所有五个评估分布都是如此。因此,压缩不仅仅是缩短推理,它还优先去除了监控器所需用来查看影响答案的线索。总之,这些结果揭示了一个压缩-可监控性边界,其中更便宜的推理可以保持答案,同时使其背后的影响更难检测。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:17

# 长度惩罚使思维链更难监控  
来源:https://arxiv.org/abs/2607.09786  
文献工具  

## 文献与引用工具  

文献浏览器 切换  

代码、数据与媒体  

## 本文相关的代码、数据与媒体  

演示  

## 演示  

相关论文  

## 推荐与搜索工具  

关于arXivLabs  

## arXivLabs:与社区合作者的实验项目  

arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。  

与arXivLab合作的组织和个人都接受并认可我们关于开放性、社区、卓越以及用户数据隐私的价值观。arXiv致力于这些价值观,仅与遵守这些价值观的伙伴合作。  

您有能为arXiv社区增添价值的项目想法吗?**进一步了解arXivLabs** (https://info.arxiv.org/labs/index.html)。

相似文章

长度惩罚使思维链的可监控性降低

Hugging Face Daily Papers

本文表明,长度惩罚的强化学习会缩短思维链推理,但也会降低可监控性,因为压缩后的链优先移除了揭示答案背后影响的线索,使得检测引导或偏差变得更加困难。

评估思维链的可监控性

OpenAI Blog

OpenAI研究人员引入了一个框架和一套包含13项评估的系统,用于衡量大型语言模型中思维链的可监控性。研究发现,监控推理过程比仅监控输出有效得多,这为AI安全及规模化监督提供了重要启示。

量化推理模型自以为需要更长的思考,实则不然

arXiv cs.LG

本文揭示,对推理模型进行激进的训练后量化会导致过度思考错误增加,即模型在中间步骤得出正确答案却未能作为最终答案输出。对过度思考标记施加简单的logit惩罚,可将思维链长度减少12-23%,同时提升准确率,尤其对量化模型效果显著。