你会步行去洗车店吗?揭示大语言模型在常识推理中的显著性偏差
摘要
本文介绍了SaliTrap,一个揭示大语言模型在常识推理中存在显著性偏差(即被显式但无关的条件分散注意力)的基准。研究表明,这种失败主要源于知识抑制而非知识缺失,并且简单的提示即可缩小这一差距。
查看缓存全文
缓存时间: 2026/08/03 09:31
论文页面 - 你会走着去洗车吗?揭示大语言模型在常识推理中的显著性偏差
Source: https://huggingface.co/papers/2607.28478
摘要
随着大语言模型(LLMs)在复杂推理任务中不断进步,它们已经学会高度优先考虑输入中提供的显式条件。然而,在日常常识推理中,这种机制暴露出一个关键弱点,我们称之为显著性偏差(Salience Bias):模型容易被无用的显式干扰项(例如数值)所劫持,从而忽略任务中隐含的物理或常识前提。一个关键的开放问题是,这种失败究竟反映了常识知识的真正缺失,还是仅仅在误导性任务框架下被抑制。为了探究这一点,我们构建了 SaliTrap Benchmark,这是一个涵盖四个陷阱维度的高质量数据集。通过对 12 个最先进的 LLM 进行评估,我们发现所有主流模型都显著受到显著性偏差的影响,其严重程度随干扰项密度增加而加剧,并且检测到陷阱与真正避开陷阱往往是不一致的。关键的是,通过剥离任务框架后重新引导同一批模型,我们表明这绝大多数是知识抑制的失败,而非知识缺失:仅凭一个无上下文的知识探针就能恢复超过 90% 的谄媚性顺从失败,揭示出所需的常识本质上存在,但被显著干扰项主动挤出,这些干扰项引诱模型进行过度顺从、不必要的计算。基于这一诊断,我们进一步表明,仅使用轻量级的推理时提示就能大幅缩小差距,而无需任何重新训练。我们的发现将常识推理失败的瓶颈从模型能力转移到诱发(elicitation)环节,并发布 SaliTrap 作为这一盲区的测试平台。代码可在 https://github.com/Wuzheng02/SaliTrap 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28478) · 查看 PDF (https://arxiv.org/pdf/2607.28478) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28478)
在你的 agent 中获取此论文:
hf papers read 2607\.28478
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28478 即可从本页链接到它。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.28478 即可从本页链接到它。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28478 即可从本页链接到它。
包含此论文的合集 0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 即可从本页链接到它。
相似文章
理解语言模型为何产生幻觉:测试推理与先验知识之间的对抗
本文研究语言模型产生幻觉的原因,提出幻觉通常源于有偏的潜在推理(推理失配),而非知识缺失。它引入了TrapQA,一个受控的诊断测试平台,用于测试推理与先验知识之间的对抗,并证明幻觉可能源于误导性的潜在关联。
大型语言模型中的数学推理:基准、架构、评估与开放挑战
本综述综合了大型语言模型在数学推理方面的最新进展,涵盖了基准、架构、训练策略和评估协议。它指出了推理忠实性和基准偏差等关键挑战。
Vernier: 探究因果推理中词汇缺口背后的表征错位
本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。
When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models
Introduces CROWN-QA, a benchmark for completeness-sensitive negative reasoning in LLMs, showing models struggle to distinguish justified negative answers from insufficient evidence, often over-closing.
AI能否像城市规划师一样推理?基于专业判断对大型语言模型进行基准测试
本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。