当多个答案都有效时,投票会失效:面向LLM的Best-of-K因果推理符号验证
摘要
本文介绍了CALVER,一种无需训练的符号验证器,它根据Pearl的因果准则对结构化因果推理轨迹进行评分,以选出最佳候选答案;在存在多个有效答案的因果推理基准上,其表现优于plurality投票和其他选择方法。
查看缓存全文
缓存时间: 2026/08/05 17:46
论文页面 - 当许多答案都有效时,投票会失败:LLM 中 Best-of-K 因果推理的符号验证
来源:https://huggingface.co/papers/2608.03506
摘要
自洽性假设采样推理轨迹中出现频率最高的答案最为可靠,但在因果推理中这可能失效:样本往往重复相同的混淆误差,而投票会分散到多个有效答案上,导致尽管存在有效的少数轨迹,无效答案仍可能获胜。我们提出了 CALVER(Causal Axiom-Level VERification,因果公理级验证),一种免训练的符号验证器,它根据 Pearl 的因果准则(包括 d-分离、后门调整和干预)对结构化轨迹进行评分,并在不参考参考答案的情况下选出得分最高的候选。在 CLEAR 上允许存在多个图有效答案的 find-one-valid 查询中,CALVER 达到了 42.1%,而在相同的固定池上,多数投票、奖励模型、LLM 评审和模型置信度仍保持在 30% 左右。将评审模型扩展到 72B 也没有缩小这一差距。在经审计的干净核心子集中,CALVER 选出的 21 个图有效答案中有 11 个不同于基准测试列出的答案,但仍满足所要求的谓词。这一优势随着采样预算的增加而扩大,并在十个已发表的贝叶斯网络、第二个模型系列以及模型必须从文本构建图的设置中重现。CALVER 还改进了基于精确真值的阈值化平均处理效应决策,在真值表检查器下泛化到逻辑推理,并能在 CPU 上以毫秒级时间为每个候选评分。CALVER 只需要一个因果结构,既可直接提供,也可从文本中构建;只要满足这一条件,就可以通过因果有效性进行选择聚合。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03506) 查看 PDF (https://arxiv.org/pdf/2608.03506) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03506)
在您的 agent 中获取此论文:
hf papers read 2608\.03506
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.03506,即可从此页面链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.03506,即可从此页面链接到该数据集。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.03506,即可从此页面链接到该 Space。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到该收藏集。
相似文章
从因果合理性到因果可靠性:评估大型语言模型作为校准的直接因果边分类器
本文系统评估了12个经过指令微调的开源权重大型语言模型在基准测试中的表现,以评估其在分类直接因果边方面的可靠性。研究发现,这些模型具有召回率主导的特点,常常过度自信,并且跨提示/模型一致性比语言化置信度能更好地改善校准。
逻辑正则化验证器激发大语言模型的推理能力
介绍了 LoVer,一种使用逻辑规则(否定一致性、组内一致性和组间一致性)来在无标签数据下提升大语言模型推理能力的无监督验证器,在推理基准测试中达到了接近监督验证器的性能。
[R] CausalVLBench:大型视觉语言模型中视觉因果推理的基准测试。
这篇arXiv论文介绍了CausalVLBench,这是一个用于评估大型视觉语言模型中视觉因果推理的基准,涵盖三个任务:因果结构推断、干预目标预测和反事实预测。它在三个因果表示学习数据集上评估了开源LVLM,揭示了其优势与不足。
@lateinteraction: 非常酷的工作!!
Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。
Vernier: 探究因果推理中词汇缺口背后的表征错位
本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。