@rohanpaul_ai: 人类通常需要先掌握基础再学习高级技能;我们需要在了解更难的事物之前先知道基础知识…
摘要
一篇论文对8个LLM与超过18,000名人类学习者进行了比较,发现LLM的高准确率可能掩盖了基础知识的不连贯性,并推荐使用连贯的问题集进行评估。
查看缓存全文
缓存时间: 2026/09/12 21:00
人类通常需要先掌握基础才能进阶学习;必须了解基础知识才能攻克更难的课题。
但大型语言模型却常常能直接答出进阶问题,却忽略了底层的基础知识。
该研究对比了8个大语言模型与超过18,000名人类学习者的表现,探究核心问题:如果能解决更难的问题,是否也能掌握其包含的前置基础知识?
人类学习者的知识体系表现出显著连贯性。
他们总体得分79.6%,且在正确答案中,72.7%的情况同时正确掌握了所有测试过的前置知识点。
而通义千问-80B-指令版虽然得分更高(92.5%),但在其正确答案中,知识连贯性仅达到48.16%。
在另一项测试中,前置知识点示例并不总是比同技能或相似技能示例更有效。
即便是标准的推理评估方法也大多未能发现这种知识割裂现象。
因此,高准确率可能掩盖了知识体系中的割裂模块。
研究建议:评估推理模型时应采用串联的易难问题组合,而非仅依赖孤立的基准测试题。
相似文章
@rohanpaul_ai: LLMs 经常低估它们需要的信息量,因此测试它们何时停止,而不是仅依赖答案准确……
一条推文总结了一篇 arxiv 论文,该论文评估了 LLMs 如何处理多轮信息搜索,强调 LLMs 经常低估其信息需求,并可能依赖先验知识而非收集充分证据。
@rohanpaul_ai: 耶鲁大学和芝加哥大学的这篇论文表明,LLM生成的研究思路与人类之间的真正差距不在于思路质量,而在于思路范围:LLM的思维比人类研究者更窄。
这篇来自耶鲁大学和芝加哥大学的论文发现,LLM生成的研究思路与人类研究思路的主要区别不在于质量,而在于范围:LLM产生的思路更窄,其中47%-64%的思路侧重于连接不同的工作,而人类的这一比例仅为12.1%。
@rohanpaul_ai: 大语言模型可以从没有已知答案的问题中学习更好的编码行为。许多实际问题并没有现成的标准答案...
论文提出了一种名为 RiVER 的强化学习方法,该方法通过对程序在隐藏测试用例上进行排序并提供分级反馈,提升了大语言模型在没有已知标准答案的问题上的编码表现。
@rohanpaul_ai: 新的微软与约克大学论文认为,在没有明确测试和更窄的声明之前,不应将LLM视为类人…
微软与约克大学的一篇论文指出,由于实验设计存在缺陷,将类人属性归因于LLM是有问题的,并以《帝国时代II》为例说明测量问题。
@rohanpaul_ai: LLM 代理能否通过交互发现隐藏规则?答案令人不安。隐藏世界越复杂…
本文研究了LLM代理是否可以通过交互推断隐藏的世界模型,发现随着复杂性的增加,它们难以构建稳定的内部模型。