commonsense-reasoning

标签

Cards List
#commonsense-reasoning

@rohanpaul_ai: 推理模型在许多与人类相同的问题上表现挣扎,同样的问题常常拖慢人类和推理模型的速度……

X AI KOLs Following · 2026-09-05 缓存

一篇论文发现,推理模型和人类在相似的常识性问题上都会遇到困难,且在多次运行取平均值后,思维链(Chain-of-Thought)的 token 数量与人类反应时间呈正相关,这使其成为衡量问题难度的更可靠信号。

0 人收藏 0 人点赞
#commonsense-reasoning

@rohanpaul_ai:大语言模型可能知道任务不可能完成,却仍然会优化它。问是步行还是开车去50米外的洗车店…

X AI KOLs Following · 2026-08-02 缓存

一篇新论文提出了SaliTrap,一个包含1,145个提示的基准测试,揭示了大语言模型知道任务不可能完成,但仍然会针对显式细节进行优化,这种失败被称为显著性偏差。即使是最好的模型,也只有约55%的时间能避开陷阱,而且察觉陷阱往往并不能阻止其遵从。

0 人收藏 0 人点赞
#commonsense-reasoning

你会步行去洗车店吗?揭示大语言模型在常识推理中的显著性偏差

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了SaliTrap,一个揭示大语言模型在常识推理中存在显著性偏差(即被显式但无关的条件分散注意力)的基准。研究表明,这种失败主要源于知识抑制而非知识缺失,并且简单的提示即可缩小这一差距。

0 人收藏 0 人点赞
#commonsense-reasoning

TouchThinker:利用大规模数据和动作感知表示将触觉常识推理扩展到开放世界

arXiv cs.AI · 2026-06-11 缓存

TouchThinker 引入了百万量级的触觉推理数据集和基准,利用动作感知表示实现高效推理,将触觉常识推理扩展到开放世界场景。

0 人收藏 0 人点赞
#commonsense-reasoning

STALE:LLM智能体能否识别记忆何时失效?

Hugging Face Daily Papers · 2026-05-07 缓存

本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈