@rohanpaul_ai:Meta的论文显示,量化推理模型常常因为反复怀疑正确答案而非完成推理而失败…

X AI KOLs Following 论文

摘要

Meta的论文表明,量化推理模型常常失败,因为压缩使它们对正确答案产生怀疑,但通过对“wait”或“but”等犹豫词施加轻微惩罚,可以将推理长度缩短12-23%,同时保持或提高准确性。

Meta的论文显示,量化推理模型常常因为不断怀疑正确答案而非完成推理而失败。 许多模型推理能力足够,但压缩使它们在错误时机犹豫不决。 问题在于训练后量化(一种在训练后缩小模型的方法)虽然能降低推理模型的运行成本,却使其难以干净利落地完成推理。 作者发现,强量化并非单纯降低模型能力——在许多失败案例中,模型已经得到了正确答案,却又自我怀疑。 他们的核心观点是:量化会在不确定的词语选择中引入噪声,使模型更倾向于选择“wait”、“but”或“alternatively”等重新打开问题的词语。 他们在数学、编程和科学任务上测试了5个推理模型、多种量化方法以及1.5B到32B的模型规模。 主要结果是:激进的量化将过度思考失败率提高了52%,而对50个犹豫词施加轻微惩罚后,推理长度缩短了12%至23%,且通常能保持或提高准确率。 鉴于压缩模型被广泛用于节省内存和成本,了解一个很小的解码修复就能阻止许多模型浪费token和丢失已有正确答案,这一点至关重要。 ---- – arxiv.org/abs/2606.00206 标题:“量化推理模型认为它们需要思考更长时间,但实际上并不需要”
查看原文
查看缓存全文

缓存时间: 2026/07/22 12:23

Meta的论文显示,量化推理模型常常失败,因为它们不断怀疑正确答案而非直接完成推理。

这些模型大多推理能力尚可,但压缩技术导致它们在错误时机犹豫不决。

问题在于训练后量化(一种在训练后压缩模型的方法)虽能降低推理模型的运行成本,却会破坏其干净利落地完成推理的能力。

研究者发现,强量化不仅削弱模型能力——许多失败案例中模型已得出正确答案,却又自我怀疑。

其核心观点是:量化会在不确定的词选择上引入噪声,使模型更容易选中“等等“、“但是“或“或者“这类重新打开问题的词。

他们使用5个推理模型、多种量化方法及1.5B至32B的参数规模,在数学、编程和科学任务上进行了测试。

主要结论是:激进的量化导致“过度思考“失败率最高提升52%,而对50个犹豫词施加微小惩罚,可将推理长度缩短12%至23%,且通常能保持或提升准确率。

鉴于压缩模型被广泛用于节省内存与成本,这一发现意义重大:非常小的解码修正就能阻止许多模型浪费token并丢失已得出的答案。


– arxiv. org/abs/2606.00206

标题:“量化推理模型认为自己需要更长的推理时间,实则不然”

相似文章

量化推理模型自以为需要更长的思考,实则不然

arXiv cs.LG

本文揭示,对推理模型进行激进的训练后量化会导致过度思考错误增加,即模型在中间步骤得出正确答案却未能作为最终答案输出。对过度思考标记施加简单的logit惩罚,可将思维链长度减少12-23%,同时提升准确率,尤其对量化模型效果显著。

提示微调:数据越少,推理能力越强

arXiv cs.CL

本文提出了一种名为“提示微调”(Hint Tuning)的数据高效方法,该方法根据问题难度校准推理深度,从而减少推理模型中的标记使用量。在仅需1K个自标注样本的情况下,该方法在 Qwen3-Thinking 和 DeepSeek-R1-Distill 等模型上实现了显著的标记减少(24%-66%)。