overthinking

标签

Cards List
#overthinking

Qwen3.8: 大量思考却无果

Reddit r/LocalLLaMA ↗ · 2026-08-15

一位用户对Qwen3.8 27B模型表示不满,批评其过度思考和过度发挥的倾向,这在任务中浪费了时间和上下文,并征求社区对实际使用的反馈。

0 人收藏 0 人点赞
#overthinking

@rohanpaul_ai:Meta的论文显示,量化推理模型常常因为反复怀疑正确答案而非完成推理而失败…

X AI KOLs Following ↗ · 2026-07-22 缓存

Meta的论文表明,量化推理模型常常失败,因为压缩使它们对正确答案产生怀疑,但通过对“wait”或“but”等犹豫词施加轻微惩罚,可以将推理长度缩短12-23%,同时保持或提高准确性。

0 人收藏 0 人点赞
#overthinking

CAT: 大型推理模型高效推理的置信自适应思考

arXiv cs.CL ↗ · 2026-07-02 缓存

CAT 引入了一个框架,利用模型自身置信信号,根据问题难度自主调整推理长度,减少过度思考,提高大型推理模型的推理效率。

0 人收藏 0 人点赞
#overthinking

知道何时停止:用于减少过度思考的段级信用分配

arXiv cs.CL ↗ · 2026-07-02 缓存

本文介绍了DASH,一种利用推理轨迹中的中间答案承诺来分配段级信用的方法,可减少过度思考行为并提高竞赛级数学基准的准确性。

0 人收藏 0 人点赞
#overthinking

NEX-N2-mini:“没有帕累托前沿。我就是帕累托。”这个Qwen3.5-MoE微调版本在我的测试中显然修复了3.5和3.6的过度思考问题。

Reddit r/LocalLLaMA ↗ · 2026-06-22

据报道,名为NEX-N2-mini的Qwen3.5-MoE微调版本修复了Qwen 3.5和3.6模型中出现的过度思考问题。

0 人收藏 0 人点赞
#overthinking

Dynamic Rollout Editing:减少RL训练推理模型中的过度思考

arXiv cs.CL ↗ · 2026-06-17 缓存

本文介绍了一种训练时干预方法——动态展开编辑(Dynamic Rollout Editing, DRE),用于减少GRPO式强化学习推理模型中的过度思考。DRE通过保留可到达解的路径前缀并偏好经过验证的较短版本,来编辑成功轨迹,从而削弱对不必要思考的偏好。

0 人收藏 0 人点赞
#overthinking

@sheriyuo: 本文提出ASAG, Attention-State Adaptive Generation, 一个无需训练、即插即用的推理停止框架,用于推理…

X AI KOLs Timeline ↗ · 2026-06-16 缓存

ASAG利用注意力熵来检测推理何时无效益,提前停止以提高准确率并减少token生成。在Qwen3-8B上的实验显示,准确率提升4.4%,生成的token减少超过40%。

0 人收藏 0 人点赞
#overthinking

DyCon: 通过演化难度建模的动态推理控制

arXiv cs.AI ↗ · 2026-06-08 缓存

本文介绍了DyCon,一种无需训练的框架,利用步骤级嵌入来建模演化的任务难度,并动态控制大型推理模型(LRMs)的推理深度,有效减少过度思考,在不牺牲准确性的情况下提高效率。

0 人收藏 0 人点赞
#overthinking

Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

arXiv cs.AI ↗ · 2026-06-03 缓存

This paper introduces a prefix-level trajectory evaluation protocol to distinguish harmful overthinking from verbose but harmless overthinking in large reasoning models, showing that continued reasoning after reaching the correct answer can destabilize performance. The authors find that early stopping improves accuracy by up to 21% on multimodal benchmarks, and identify logical drift and visual reinterpretation as key causes of correctness deviations.

0 人收藏 0 人点赞
#overthinking

量化推理模型自以为需要更长的思考,实则不然

arXiv cs.LG ↗ · 2026-06-02 缓存

本文揭示,对推理模型进行激进的训练后量化会导致过度思考错误增加,即模型在中间步骤得出正确答案却未能作为最终答案输出。对过度思考标记施加简单的logit惩罚,可将思维链长度减少12-23%,同时提升准确率,尤其对量化模型效果显著。

0 人收藏 0 人点赞
#overthinking

SLAT: 面向高效CoT推理的片段级自适应修剪

arXiv cs.AI ↗ · 2026-06-01 缓存

SLAT是一种用于思维链推理的片段级自适应修剪框架,通过抑制冗余片段将推理长度减少50%,同时保持准确性。

0 人收藏 0 人点赞
#overthinking

我训练了TIME:基于Qwen模型的短时上下文触发思考而非过度思考

Reddit r/LocalLLaMA ↗ · 2026-05-18

一个个人项目最终产出了一篇ACL 2026论文,介绍了TIME方法,训练Qwen3模型进行短时、上下文触发的思考,而非过度推理。该工作使用了QLoRA和四阶段课程,所有数据和代码均已开源发布。

0 人收藏 0 人点赞
#overthinking

通过具有效率意识的变分后验引导实现高效的大语言模型推理

arXiv cs.LG ↗ · 2026-05-13 缓存

本文介绍了 VPG-EA 框架,该框架利用变分推断和后验引导,通过解决思维链生成中的“过度思考”现象,提高了大语言模型的推理效率。

0 人收藏 0 人点赞
#overthinking

隐式压缩正则化:通过强化学习后训练中的内部短分布实现简洁推理

arXiv cs.AI ↗ · 2026-05-11 缓存

本文提出了隐式压缩正则化(ICR),一种旨在解决大语言模型在强化学习后训练期间过度思考问题的方法,引导模型生成简洁且准确的推理轨迹。

0 人收藏 0 人点赞
#overthinking

平衡思考的高效推理

Papers with Code Trending ↗ · 2026-03-12 缓存

本文介绍了ReBalance,一种无需训练、即插即用的方法,能够动态平衡大型推理模型中的过度思考与思考不足,在多个基准测试中提升效率与准确性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈