你会步行去洗车店吗?揭示大语言模型在常识推理中的显著性偏差

Hugging Face Daily Papers 论文

摘要

本文介绍了SaliTrap,一个揭示大语言模型在常识推理中存在显著性偏差(即被显式但无关的条件分散注意力)的基准。研究表明,这种失败主要源于知识抑制而非知识缺失,并且简单的提示即可缩小这一差距。

随着大型语言模型(LLMs)在复杂推理任务中不断进步,它们学会了高度优先处理输入中提供的显式条件。然而,在日常常识推理中,这种机制暴露了一个关键漏洞,我们称之为显著性偏差(Salience Bias):模型容易被无用的显式干扰物(例如数值)所劫持,从而忽略任务隐含的物理或常识前提。一个关键悬而未决的问题是,这种失败究竟反映了常识知识的真实缺失,还是仅仅在误导性任务框架下的知识抑制。为了探究这一点,我们构建了SaliTrap基准,这是一个涵盖四个陷阱维度的高质量数据集。在对12个最先进的大语言模型进行评估后,我们发现所有主流模型都显著受到显著性偏差的影响,其严重程度随干扰物密度而增加,而且检测到陷阱往往与实际避开陷阱并不一致。关键在于,通过去除任务框架后重新激发相同的模型,我们表明这主要是知识抑制而非知识缺失的失败:仅凭一个无上下文的知识探针就能恢复超过90\%的谄媚性顺从失败,揭示出所需的常识本质上存在,但被显著的干扰物主动排挤出去,这些干扰物诱使模型进行过度顺从、不必要的计算。基于这一诊断,我们进一步表明,仅靠轻量级的推理时提示就能大幅缩小差距,而无需重新训练。我们的发现将常识推理失败的瓶颈从模型能力重新定位到激发(elicitation)层面,并发布SaliTrap作为这一盲点的测试平台。代码可在 https://github.com/Wuzheng02/SaliTrap 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/03 09:31

论文页面 - 你会走着去洗车吗?揭示大语言模型在常识推理中的显著性偏差

Source: https://huggingface.co/papers/2607.28478

摘要

随着大语言模型(LLMs)在复杂推理任务中不断进步,它们已经学会高度优先考虑输入中提供的显式条件。然而,在日常常识推理中,这种机制暴露出一个关键弱点,我们称之为显著性偏差(Salience Bias):模型容易被无用的显式干扰项(例如数值)所劫持,从而忽略任务中隐含的物理或常识前提。一个关键的开放问题是,这种失败究竟反映了常识知识的真正缺失,还是仅仅在误导性任务框架下被抑制。为了探究这一点,我们构建了 SaliTrap Benchmark,这是一个涵盖四个陷阱维度的高质量数据集。通过对 12 个最先进的 LLM 进行评估,我们发现所有主流模型都显著受到显著性偏差的影响,其严重程度随干扰项密度增加而加剧,并且检测到陷阱与真正避开陷阱往往是不一致的。关键的是,通过剥离任务框架后重新引导同一批模型,我们表明这绝大多数是知识抑制的失败,而非知识缺失:仅凭一个无上下文的知识探针就能恢复超过 90% 的谄媚性顺从失败,揭示出所需的常识本质上存在,但被显著干扰项主动挤出,这些干扰项引诱模型进行过度顺从、不必要的计算。基于这一诊断,我们进一步表明,仅使用轻量级的推理时提示就能大幅缩小差距,而无需任何重新训练。我们的发现将常识推理失败的瓶颈从模型能力转移到诱发(elicitation)环节,并发布 SaliTrap 作为这一盲区的测试平台。代码可在 https://github.com/Wuzheng02/SaliTrap 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28478) · 查看 PDF (https://arxiv.org/pdf/2607.28478) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28478)

在你的 agent 中获取此论文:

hf papers read 2607\.28478

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28478 即可从本页链接到它。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28478 即可从本页链接到它。

引用此论文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.28478 即可从本页链接到它。

包含此论文的合集 0

没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 即可从本页链接到它。

相似文章

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。