@rohanpaul_ai:Meta的论文显示,量化推理模型常常因为反复怀疑正确答案而非完成推理而失败…
摘要
Meta的论文表明,量化推理模型常常失败,因为压缩使它们对正确答案产生怀疑,但通过对“wait”或“but”等犹豫词施加轻微惩罚,可以将推理长度缩短12-23%,同时保持或提高准确性。
查看缓存全文
缓存时间: 2026/07/22 12:23
Meta的论文显示,量化推理模型常常失败,因为它们不断怀疑正确答案而非直接完成推理。
这些模型大多推理能力尚可,但压缩技术导致它们在错误时机犹豫不决。
问题在于训练后量化(一种在训练后压缩模型的方法)虽能降低推理模型的运行成本,却会破坏其干净利落地完成推理的能力。
研究者发现,强量化不仅削弱模型能力——许多失败案例中模型已得出正确答案,却又自我怀疑。
其核心观点是:量化会在不确定的词选择上引入噪声,使模型更容易选中“等等“、“但是“或“或者“这类重新打开问题的词。
他们使用5个推理模型、多种量化方法及1.5B至32B的参数规模,在数学、编程和科学任务上进行了测试。
主要结论是:激进的量化导致“过度思考“失败率最高提升52%,而对50个犹豫词施加微小惩罚,可将推理长度缩短12%至23%,且通常能保持或提升准确率。
鉴于压缩模型被广泛用于节省内存与成本,这一发现意义重大:非常小的解码修正就能阻止许多模型浪费token并丢失已得出的答案。
– arxiv. org/abs/2606.00206
标题:“量化推理模型认为自己需要更长的推理时间,实则不然”
相似文章
量化推理模型自以为需要更长的思考,实则不然
本文揭示,对推理模型进行激进的训练后量化会导致过度思考错误增加,即模型在中间步骤得出正确答案却未能作为最终答案输出。对过度思考标记施加简单的logit惩罚,可将思维链长度减少12-23%,同时提升准确率,尤其对量化模型效果显著。
@rohanpaul_ai: 这篇论文揭示了AI推理中的一个奇怪弱点:模型可以解决数学问题,却无法判断推理过程。令人不安的是…
这篇论文提出了Valid-Answer-Invalid-Reasoning (VAIR)基准测试,旨在揭示AI推理模型中的生成-评估差距,即模型可以生成正确答案,但无法检测出有缺陷的推理过程,暴露了答案确认偏差。
@rohanpaul_ai: 一篇关于推理模型训练后如何改进的入门论文 表明更好的推理模型较少依赖原始……
这篇入门论文探讨了推理模型在训练后如何改进,认为有效的推理数据更多地依赖于可检查的训练证据而非原始数据量。它根据验证方法对推理数据进行分类,并强调保留混乱的智能体数据以获取学习信号。
量化LLM推理中的无声失败:基于分类法的空洞收敛与失败模式转变分析
本文通过一个基于分类法的分析,对多个模型和基准测试中的30,000个思维链输出进行研究,证明了训练后量化可以无声地改变大语言模型的推理方式,即使任务准确性保持不变。
提示微调:数据越少,推理能力越强
本文提出了一种名为“提示微调”(Hint Tuning)的数据高效方法,该方法根据问题难度校准推理深度,从而减少推理模型中的标记使用量。在仅需1K个自标注样本的情况下,该方法在 Qwen3-Thinking 和 DeepSeek-R1-Distill 等模型上实现了显著的标记减少(24%-66%)。