当多个答案都有效时,投票会失效:面向LLM的Best-of-K因果推理符号验证

Hugging Face Daily Papers 论文

摘要

本文介绍了CALVER,一种无需训练的符号验证器,它根据Pearl的因果准则对结构化因果推理轨迹进行评分,以选出最佳候选答案;在存在多个有效答案的因果推理基准上,其表现优于plurality投票和其他选择方法。

自洽性(self-consistency)假设采样推理轨迹中出现频率最高的答案最可靠,但在因果推理中这一假设可能失效:样本常常重复相同的混杂错误,且投票分散在多个有效答案之间,导致无效答案获胜,尽管存在有效的少数轨迹。我们提出CALVER(Causal Axiom-Level VERification,因果公理级验证),这是一种无需训练、基于符号的验证器,它根据Pearl的因果准则(包括d-分离、后门调整和干预)对结构化轨迹进行评分,并在不参考参考答案的情况下选择得分最高的候选答案。在允许多个图有效答案的CLEAR find-one-valid查询上,CALVER达到42.1%,而在相同的冻结池上,plurality投票、奖励模型、LLM裁判和模型置信度均保持在约30%。将裁判模型扩展到72B并不能缩小这一差距。在经过审计的clean-core子集中,21个图有效CALVER选择中有11个与基准列出的答案不同,但仍满足所请求的谓词。这一优势随采样预算增加而扩大,并在十个已发表的贝叶斯网络、第二个模型家族以及需要从文本构建图表的设置中复现。CALVER还改进了针对精确真实值的阈值化平均处理效应决策,在真值表检查器下可推广到逻辑推理,并且在CPU上可在毫秒内对每个候选进行评分。CALVER只需要因果结构——直接提供或从文本中构建;只要满足这一条件,选择就能通过因果有效性进行聚合。
查看原文
查看缓存全文

缓存时间: 2026/08/05 17:46

论文页面 - 当许多答案都有效时,投票会失败:LLM 中 Best-of-K 因果推理的符号验证

来源:https://huggingface.co/papers/2608.03506

摘要

自洽性假设采样推理轨迹中出现频率最高的答案最为可靠,但在因果推理中这可能失效:样本往往重复相同的混淆误差,而投票会分散到多个有效答案上,导致尽管存在有效的少数轨迹,无效答案仍可能获胜。我们提出了 CALVER(Causal Axiom-Level VERification,因果公理级验证),一种免训练的符号验证器,它根据 Pearl 的因果准则(包括 d-分离、后门调整和干预)对结构化轨迹进行评分,并在不参考参考答案的情况下选出得分最高的候选。在 CLEAR 上允许存在多个图有效答案的 find-one-valid 查询中,CALVER 达到了 42.1%,而在相同的固定池上,多数投票、奖励模型、LLM 评审和模型置信度仍保持在 30% 左右。将评审模型扩展到 72B 也没有缩小这一差距。在经审计的干净核心子集中,CALVER 选出的 21 个图有效答案中有 11 个不同于基准测试列出的答案,但仍满足所要求的谓词。这一优势随着采样预算的增加而扩大,并在十个已发表的贝叶斯网络、第二个模型系列以及模型必须从文本构建图的设置中重现。CALVER 还改进了基于精确真值的阈值化平均处理效应决策,在真值表检查器下泛化到逻辑推理,并能在 CPU 上以毫秒级时间为每个候选评分。CALVER 只需要一个因果结构,既可直接提供,也可从文本中构建;只要满足这一条件,就可以通过因果有效性进行选择聚合。

查看 arXiv 页面 (https://arxiv.org/abs/2608.03506) 查看 PDF (https://arxiv.org/pdf/2608.03506) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03506)

在您的 agent 中获取此论文:

hf papers read 2608\.03506

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.03506,即可从此页面链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.03506,即可从此页面链接到该数据集。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.03506,即可从此页面链接到该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到该收藏集。

相似文章

逻辑正则化验证器激发大语言模型的推理能力

arXiv cs.CL

介绍了 LoVer,一种使用逻辑规则(否定一致性、组内一致性和组间一致性)来在无标签数据下提升大语言模型推理能力的无监督验证器,在推理基准测试中达到了接近监督验证器的性能。

@lateinteraction: 非常酷的工作!!

X AI KOLs Timeline

Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。