@rohanpaul_ai: 推理模型在许多与人类相同的问题上表现挣扎,同样的问题常常拖慢人类和推理模型的速度……

X AI KOLs Following 论文

摘要

一篇论文发现,推理模型和人类在相似的常识性问题上都会遇到困难,且在多次运行取平均值后,思维链(Chain-of-Thought)的 token 数量与人类反应时间呈正相关,这使其成为衡量问题难度的更可靠信号。

推理模型在许多与人类相同的问题上表现挣扎。 同样的问题常常拖慢人类和推理模型的速度。推理 token 的消耗量能在一定程度上反映问题的难度,但这篇论文指出,不应轻信仅单次模型运行的结果。 研究人员将人类的反应时间与模型在 160 个常识性“最佳解释”问题上消耗的推理 token 数量进行了对比。 人类耗时更久的问题通常也会让模型“思考”更长时间,而且人类和模型往往会在相同的问题上答错。 有趣的是,当模型尝试不同的推理路径并对结果取平均值时,这一信号变得更加明显。对于 GPT-OSS-20B,人类与模型之间的相关性从 0.41 上升到了 0.55。 因此,思维链(Chain-of-Thought)的长度可以作为衡量问题难度的一个有用的粗略指标,但需要在多次运行中进行测量。这让模型的“努力程度”成为更有用的评估信号。
查看原文
查看缓存全文

缓存时间: 2026/09/06 08:42

推理模型在许多人类同样难以应对的问题上也表现不佳。

同样的问题常常让人类和推理模型都放慢速度。推理 token 数量可以反映问题的难度,但这篇论文指出,不要轻信单次模型运行的结果。

研究人员将人类的反应时间与模型在 160 道常识性“最佳解释”问题上所使用的推理 token 数量进行了对比。

人类耗时更长的问题通常也会让模型“思考”更久,而且人类和模型往往会在相同的问题上答错。

有趣的是,当模型尝试不同的推理路径并对结果取平均后,这一信号变得更加清晰。对于 GPT-OSS-20B,人类与模型的相关性从 0.41 上升到了 0.55。

因此,思维链长度可以作为衡量问题难度的一个有用的大致指标,但需要在多次运行中测量。这让模型付出的“努力”成为更有用的评估信号。

相似文章

推理模型难以控制其思维链,但这其实是好事

OpenAI Blog

OpenAI的研究人员研究了推理模型是否能故意隐藏其思维链以逃避监控,发现当前模型即使知道自己被监控,也难以控制自己的推理过程。他们推出了CoT-Control,一个包含超过13,000个任务的开源评估套件,用于衡量推理模型中思维链的可控性。

思维链推理在实际应用中并非总是忠实的

Hacker News Top

本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。