@rohanpaul_ai: 人类通常需要先掌握基础再学习高级技能;我们需要在了解更难的事物之前先知道基础知识…

X AI KOLs Following 论文

摘要

一篇论文对8个LLM与超过18,000名人类学习者进行了比较,发现LLM的高准确率可能掩盖了基础知识的不连贯性,并推荐使用连贯的问题集进行评估。

人类通常需要先掌握基础再学习高级技能;我们需要在了解更难的事物之前先知道基础知识。 但LLM可能正确回答高级问题,却忽略了其下的基础。 这篇论文比较了8个LLM和超过18,000名人类学习者,并提出问题:如果能解决更难的问题,是否也能解决其下的更简单技能? 人类的一致性要高得多。 他们的总体得分是79.6%,并且72.7%的正确答案也具备了所有测试的先决条件。 QWEN3-80B-INSTRUCT得分更高,为92.5%,但只有48.16%的正确答案达到了相同的一致性。 在一个单独的测试中,先决条件示例并不总是比同技能或相似示例更好。 即使是标准的推理评估器也大多忽略了这种模式。 因此,高准确性可能掩盖了不连贯的知识片段。 因此,论文建议:使用连贯的简单和困难问题集来评估推理模型,而不仅仅是孤立的基准问题。
查看原文
查看缓存全文

缓存时间: 2026/09/12 21:00

人类通常需要先掌握基础才能进阶学习;必须了解基础知识才能攻克更难的课题。

但大型语言模型却常常能直接答出进阶问题,却忽略了底层的基础知识。

该研究对比了8个大语言模型与超过18,000名人类学习者的表现,探究核心问题:如果能解决更难的问题,是否也能掌握其包含的前置基础知识?

人类学习者的知识体系表现出显著连贯性。

他们总体得分79.6%,且在正确答案中,72.7%的情况同时正确掌握了所有测试过的前置知识点。

而通义千问-80B-指令版虽然得分更高(92.5%),但在其正确答案中,知识连贯性仅达到48.16%。

在另一项测试中,前置知识点示例并不总是比同技能或相似技能示例更有效。

即便是标准的推理评估方法也大多未能发现这种知识割裂现象。

因此,高准确率可能掩盖了知识体系中的割裂模块。

研究建议:评估推理模型时应采用串联的易难问题组合,而非仅依赖孤立的基准测试题。

相似文章

@rohanpaul_ai: 耶鲁大学和芝加哥大学的这篇论文表明,LLM生成的研究思路与人类之间的真正差距不在于思路质量,而在于思路范围:LLM的思维比人类研究者更窄。

X AI KOLs Timeline

这篇来自耶鲁大学和芝加哥大学的论文发现,LLM生成的研究思路与人类研究思路的主要区别不在于质量,而在于范围:LLM产生的思路更窄,其中47%-64%的思路侧重于连接不同的工作,而人类的这一比例仅为12.1%。