标签
一篇论文发现,推理模型和人类在相似的常识性问题上都会遇到困难,且在多次运行取平均值后,思维链(Chain-of-Thought)的 token 数量与人类反应时间呈正相关,这使其成为衡量问题难度的更可靠信号。
一篇新论文提出了SaliTrap,一个包含1,145个提示的基准测试,揭示了大语言模型知道任务不可能完成,但仍然会针对显式细节进行优化,这种失败被称为显著性偏差。即使是最好的模型,也只有约55%的时间能避开陷阱,而且察觉陷阱往往并不能阻止其遵从。
本文介绍了SaliTrap,一个揭示大语言模型在常识推理中存在显著性偏差(即被显式但无关的条件分散注意力)的基准。研究表明,这种失败主要源于知识抑制而非知识缺失,并且简单的提示即可缩小这一差距。
TouchThinker 引入了百万量级的触觉推理数据集和基准,利用动作感知表示实现高效推理,将触觉常识推理扩展到开放世界场景。
本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。