@rohanpaul_ai: 推理模型在许多与人类相同的问题上表现挣扎,同样的问题常常拖慢人类和推理模型的速度……
摘要
一篇论文发现,推理模型和人类在相似的常识性问题上都会遇到困难,且在多次运行取平均值后,思维链(Chain-of-Thought)的 token 数量与人类反应时间呈正相关,这使其成为衡量问题难度的更可靠信号。
查看缓存全文
缓存时间: 2026/09/06 08:42
推理模型在许多人类同样难以应对的问题上也表现不佳。
同样的问题常常让人类和推理模型都放慢速度。推理 token 数量可以反映问题的难度,但这篇论文指出,不要轻信单次模型运行的结果。
研究人员将人类的反应时间与模型在 160 道常识性“最佳解释”问题上所使用的推理 token 数量进行了对比。
人类耗时更长的问题通常也会让模型“思考”更久,而且人类和模型往往会在相同的问题上答错。
有趣的是,当模型尝试不同的推理路径并对结果取平均后,这一信号变得更加清晰。对于 GPT-OSS-20B,人类与模型的相关性从 0.41 上升到了 0.55。
因此,思维链长度可以作为衡量问题难度的一个有用的大致指标,但需要在多次运行中测量。这让模型付出的“努力”成为更有用的评估信号。
相似文章
@rohanpaul_ai: 这篇论文揭示了AI推理中的一个奇怪弱点:模型可以解决数学问题,却无法判断推理过程。令人不安的是…
这篇论文提出了Valid-Answer-Invalid-Reasoning (VAIR)基准测试,旨在揭示AI推理模型中的生成-评估差距,即模型可以生成正确答案,但无法检测出有缺陷的推理过程,暴露了答案确认偏差。
@rohanpaul_ai:Meta的论文显示,量化推理模型常常因为反复怀疑正确答案而非完成推理而失败…
Meta的论文表明,量化推理模型常常失败,因为压缩使它们对正确答案产生怀疑,但通过对“wait”或“but”等犹豫词施加轻微惩罚,可以将推理长度缩短12-23%,同时保持或提高准确性。
@dbreunig: 推理模型擅长理解细微差别和自然语言。但这种细微之处尚未渗透到检索系统…
一条推文强调,尽管推理模型在理解细微差别和自然语言方面表现出色,但这种能力尚未传导到检索系统,指出了AI系统的一个关键瓶颈。
推理模型难以控制其思维链,但这其实是好事
OpenAI的研究人员研究了推理模型是否能故意隐藏其思维链以逃避监控,发现当前模型即使知道自己被监控,也难以控制自己的推理过程。他们推出了CoT-Control,一个包含超过13,000个任务的开源评估套件,用于衡量推理模型中思维链的可控性。
思维链推理在实际应用中并非总是忠实的
本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。