一把标尺:图宾根双变量因果方向的同手重新评估,附带无参数压缩基线
摘要
本文对图宾根因果对数据集上的双变量因果方向方法进行了同手重新评估,引入了一种无参数压缩基线,其表现与SLOPE持平。文章记录了已发表准确率因协议差异而虚高的情况,并公开了所有代码和数据。
arXiv:2606.23767v1 公告类型:新论文
摘要:图宾根因果对上的头条准确率经常被跨论文比较,尽管每篇论文的测量都依据其作者自己的协议——不同的子集、权重、模型选择和决策率。我们认为这是错误的比较方式,并进行了正确的比较:同手重新评估,即由我们对相同的102对样本运行每种方法,并严格遵守一条规则——不进行调参,且强制对每一对做出决策。作为清晰的参考点,我们引入了一个故意简化的基线:排序条件压缩,它将量化、排序、一阶差分后的数据送入现成的压缩器(bz2),并且没有可调参数。在统一标尺下,排名与文献结果显著不同。我们的基线达到74.7%的加权准确率(p = 3.7e-7);在SLOPE评估所采用的相同100对样本上,得分为76.0%,比作者自己强制决策的SLOPE(77.2%)低1.2个百分点,完全在噪声范围内(McNemar p = 0.39)。对RECI的忠实复现得分为70.7%——在原始作者报告的错误范围内,而不是经常引用的77.5%(我们发现这是由错误复制的单元格所致)。SLOPE已发表的82.4%是基于选定子集的数值:仅对作者自己的已存储输出中其显著性测试选择回答的样本对进行评分,结果为81.7%。在统一标尺下,各方法聚类在70%低到中段,无参数压缩器与其中最强的性能持平。我们记录了虚高已发表数字的机制(测试集模型选择、显著性门控的弃权),并贡献了另外两个结果:压缩分数的大小是一个无模型混杂标志(p = 2.8e-68),一项预先注册的伪造检验以具有启发性的方式失败,限定了该方法的理论解释范围。代码、预先注册及每对样本的输出均已公开。
查看缓存全文
缓存时间: 2026/06/24 07:48
# 对图宾根双变量因果方向的同条件重新评估,附带一个无参数压缩基线
来源:https://arxiv.org/html/2606.23767 (2026年6月 — 初步工作论文)
###### 摘要
论文中惯常比较图宾根因果-效应对的标题准确率,但每篇论文都是在各自作者的协议下测量的——不同的子集、权重、模型选择和决策率。我们认为这种比较是错误的,并进行了正确的比较:一个**同条件**重新评估,其中每个方法都由我们运行,在完全相同的102对上,并有一个严格规则——**无调参**且**强制对每一对做出决策**。作为一个干净的参考点,我们引入了一个故意极简的基线:**排序条件压缩**,它将量化、排序、一阶差分的数据输入到现成的压缩器(bz2)中,并且具有**零个**拟合参数。在共同的标尺下,排名与文献中的结果截然不同。我们的基线在我们的102对集合上达到了74.7%的加权准确率(p=3.7×10⁻⁷)——并且在评估SLOPE的**相同100对上**得分为76.0%,比作者自己的强制决策SLOPE(77.2%)低1.2个百分点,完全在噪声范围内(McNemar p=0.39)。作者同一组的SLOPER变体在相同对上得分为71.1%(来自捆绑的sloper.tab),因此没有一种SLOPE配置在图宾根上显著优于我们。对RECI的忠实重新运行得到了70.7%——在原作者自己报告的错误条内,而**不是**经常引用的77.5%(我们追踪到这是从合成数据集的另一个方法中错误复制的单元格)。SLOPE公布的82.4%是一个**已决策子集**的数值:仅在其显著性测试选择回答的对上对作者自己存储的输出进行评分,再现了81.7%,直接展示了膨胀机制。在共同的标尺下,四种方法集中在低至中70%的范围,零参数压缩器与其中最强的方法在统计上持平。我们记录了膨胀已公布数字的机制(测试集模型选择、显著性门控弃权),并贡献了两个进一步的结果:压缩分数大小是一个无模型混杂标志(p=2.8×10⁻⁶⁸),以及一个预先注册的证伪测试以有启发性的方式失败,限制了该方法的理论解释,但没有推翻其实证结果。所有代码、预注册和逐对输出均已发布。
## 1 引言
图宾根因果-效应对(CEP)[1 (https://arxiv.org/html/2606.23767#bib.bib1)]是双变量因果方向问题的实际真实世界基准:给定已知有因果关系的一对变量 \(X, Y\) 的样本,在没有干预的情况下决定是 \(X \to Y\) 还是 \(Y \to X\)。进展通过该集合上的加权准确率来追踪,方法论文通常将新结果与从早期论文中复制的一系列先前数字并列。这种比较是不合理的。每个已公布的数字都是在自己的协议下生成的:略有不同的合格对子集(文献中出现95-108对)、不同的权重、不同的低置信度对处理方式(强制决策 vs. 弃权/决策率曲线下的面积),以及——关键的是——在观测基准性能之后做出的模型和超参数选择。仅这些选择就经常导致几个百分点的差异,因此跨论文的表既衡量了方法也衡量了协议。
本文做了真正的苹果对苹果比较。我们的贡献包括:
1. 1. **同条件协议**(§2 (https://arxiv.org/html/2606.23767#S2)):一个操作者,标准的CEP对,官方权重,无调参,强制对每一对做出决策。每个竞争对手都在相同的规则下运行——SLOPE来自作者**自己发布的代码**,RECI与作者自己报告的值匹配,IGCI和我们的基线直接测量——而不是引用标题单元格。
2. 2. **无参数参考基线**(§3 (https://arxiv.org/html/2606.23767#S3)):排序条件bz2压缩,一个具有零测试时参数的单一函数,作为固定标尺。
3. 3. **重新评估**(§4 (https://arxiv.org/html/2606.23767#S4))显示文献中的排名在共同的标尺下无法维持。我们再现了RECI**自己**报告的值(70.7%),表明广泛引用的“77.5%”是错误归属,运行作者自己的SLOPE代码在强制决策下得到77.2%,并将其公布的82.4%再现为已决策子集伪影(在其回答的对上为81.7%)。我们命名了膨胀机制。
4. 4. **两个进一步结果**(§5 (https://arxiv.org/html/2606.23767#S5)):一个来自分数大小的无模型混杂检测器,以及一个将基线失败定位于离散和接近双射对的错误分析。
5. 5. **一个诚实的边界**(§6 (https://arxiv.org/html/2606.23767#S6)):一个预先注册的证伪测试失败了,区分了该方法**是什么**(一个经过验证的经验启发式)和它**不是什么**(算法不对称性的干净估计器)。我们不声称达到最新技术水平。我们声称,在公平衡量下,一个零参数压缩器与这个特定群体中最好的方法持平,而不是落后于它,并且该领域的标题数字值得同条件审查。
## 2 同条件协议
我们固定一个评估标准并将其应用于每个方法:
- · **数据**。102个CEP对,具有标量原因、标量效应和 \(\ge 50\) 个样本,按官方的 pairmeta.txt 权重加权。
- · **强制决策**。每一对都收到一个 \(\{X\to Y, Y\to X\}\) 调用;平局算错。无弃权、无决策率曲线、无 top-\(k\) 报告。
- · **无调参**。不使用基准准确率选择任何超参数或模型类别。
- · **自己动手**。我们自行运行每个竞争对手(根据其论文或参考工具箱重新实现),而不是导入在不同协议下测量的数字。
这故意是最**严格**的合理设置;它是自然评估无参数方法的设置,我们要求竞争对手达到相同的标准。
## 3 无参数基线
给定具有 \(n\) 个样本的 \(X, Y\),通过线性最小-最大缩放将每个独立量化为256个级别,得到整数序列 \(q_x, q_y \in \{0,\dots,255\}^n\)。对于有序对(键,值),定义**排序条件编码**:
\[
\text{sc}(\text{key},\text{val}) = \| \,\mathrm{bz2}\big( \Delta(\text{val}[\arg\!\mathrm{sort}\,\text{key}]) \big) \|,
\]
其中 \(\arg\!\mathrm{sort}\) 是稳定排序,\(\Delta\) 是一阶差分转换为int8,\(\|\cdot\|\) 是压缩后的字节长度。使用边际编码 \(dc(q) = \|\mathrm{bz2}(\Delta(q))\|\),分数为:
\[
s = \frac{\text{sc}(q_y, q_x)}{\max(dc(q_x), 1)} - \frac{\text{sc}(q_x, q_y)}{\max(dc(q_y), 1)},
\]
规则是先验的:\(s > 0 \Rightarrow X\to Y\),\(s < 0 \Rightarrow Y\to X\),置信度为 \(\|s\|\)。
**直觉**。如果 \(Y = f(X) + \varepsilon\),按 \(X\) 排序 \(Y\) 会产生更平滑的序列,其一阶差分携带更少的熵并压缩得更短;反向排序则不然。边际归一化纠正了 \(X, Y\) 具有不同内在复杂性的情况。
这是可计算地替代柯尔莫哥洛夫论证 \(K(Y|X) < K(X|Y)\) 的代理。如果点数 > 8000,则线性子采样到8000。要求使用 bz2(不是 lzma):lzma 的容器开销使输出长度在约500字节以下时决定,因此对于典型的CEP序列长度,两个方向由于构造而打平(§6 (https://arxiv.org/html/2606.23767#S6))。
## 4 重新评估结果
### 4.1 基线与图宾根
在102对上,基线得分为74.7%加权准确率(先验符号,0平局),bootstrap 95% CI [63.2, 84.7]% (n=1000),\(p = 3.7\times 10^{-7}\) vs. 随机。一个200×分割半样本外检查给出74.8%,确认固定符号不是拟合的。置信度是可用的:限制到 top-\(\|s\|\) 分数单调提高准确率(表1 (https://arxiv.org/html/2606.23767#S4.T1))。
表 1:弃权曲线:准确率随置信度 \(\|s\|\) 提高。
### 4.2 一个标尺下的每个方法
表2 (https://arxiv.org/html/2606.23767#S4.T2) 报告了每个方法由我们运行,强制决策,在相同的102对上,与每个方法自己论文报告的标题对比。
表 2:同条件重新评估,强制决策,无调参。行按同条件准确率排序。‡SLOPE 是作者**自己发布的代码**在其捆绑的CEP对上运行,强制决策;其82.4%的标题再现为**已决策子集**分数(在其显著性测试回答的对上为81.7%)。†通常引用的RECI的“77.5%”是错误归属(见正文);这里的值与RECI作者自己的表匹配。两个“压缩(我们的)”行:74.7%是我们在102对集合上的预注册标题;76.0%是在作者捆绑的100对上重新运行的相同子集,SLOPE就是在这100对上评估的。在**相同的100对上**,我们的得分为76.0% vs. SLOPE的77.2%——1.2个百分点的差距,在约100对上完全在噪声范围内。
### 4.3 RECI:再现,以及77.5%的错误归属
我们忠实地按照作者[5 (https://arxiv.org/html/2606.23767#bib.bib5)]和因果发现工具箱实现RECI:将两个变量最小-最大缩放到[0,1],一个故意弱的回归器(移位单项式 \(a x^2 + c\),论文报道在真实数据上最好的类别),在随机分割上保留测试集MSE的平均值,以及较小误差是原因的规则。这在我们两个实现中得到了69.9–70.9%——正好在作者自己报告的CEP集合的 \(70.73\% \pm 1.55\) 之内。经常被引用的RECI在图宾根上的准确率77.5%在来源中并没有出现在RECI名下;最接近的值77.72%是另一个方法(ANM)在**合成**套件(SIM-G)上的结果。两个常见的再现错误将RECI降至随机水平,值得记录:使用表达性回归器(例如RBF核)能够同等好地拟合**两个**方向,消除了不对称性;以及标准化为单位方差而不是最小-最大缩放破坏了该方法定理所需的尺度条件。
### 4.4 SLOPE:82.4%是一个已决策子集分数
我们没有重新实现SLOPE,而是获取了作者**自己发布的R代码**[6 (https://arxiv.org/html/2606.23767#bib.bib6)](slope-v20181208)并在他们捆绑的CEP对上运行。在他们的代码中,只有当种子Wilcoxon-Mann-Whitney显著性测试通过(\(p < \alpha\))时,才从 \(\mathrm{sign}(\epsilon)\) 分配因果方向;否则方法弃权。他们自己的基准脚本设置 \(\alpha = 1.01\),即强制决策。这样运行时,作者的代码在他们的100对子集上得分为 **77.2%**(加权,强制)。公布的82.4%不是这个数字——它是**已决策子集**准确率。仅在作者选择回答的对上对作者自己存储的输出(slope.tab)进行评分——从分母中移除其两次弃权——得到 **81.7%**,再现了标题并直接展示了膨胀机制:显著性门让SLOPE跳过了它最不确定的对,并在剩余对上报告准确率。
两个独立的评估同意完整基准数值较低:RECI论文自己的比较发现SLOPE在CEP上“仅略好于RECI”(约低70%),并且一篇2025年的样条MDL论文[7 (https://arxiv.org/html/2606.23767#bib.bib7)]放弃SLOPE和RECI,因为它们的结果“相似或更差”于其基线。(2018年期刊的同一包中的“混合”变体得分更低,强制71.1% / 已决策75.2%。)
*溯源*。77.2% / 81.7%的数字是作者**自己的代码和存储输出**,不是重新实现;唯一的操作者选择是强制决策设置,取自他们自己的基准脚本。RECI的数字同样匹配作者自己的表。因此,两个竞争对手的数字都是权威的,不是移植的。
### 4.5 为什么标题读数更高
重复的模式是选择和弃权。RECI的协议明确“尝试了不同的[训练]比例,并在测试数据上选择表现最佳的模型”,并报告最佳表现函数类别;事先固定类别反而将RECI降至约63–65%。SLOPE从显著性门控弃权中受益。两者都是合理的选择,但它们使已公布的数字成为最佳情况而非苹果对苹果。无参数基线没有这样的旋钮,然而在严格共享的规则下,它并没有落后——它与最好的持平。
### 4.6 同条件平局在统计上真实吗?(McNemar)
在完全相同的100个CEP对上,76.0 vs. 77.2的差距是一对成对分类器比较;合适的检验是对成对层面的正确/错误表进行的McNemar检验(未加权:我们的67/100,SLOPE 73/100)。2×2表为:两者都正确53,仅我们正确14,仅SLOPE正确20,两者都错误13。McNemar的精确二项式(双尾)给出 \(p = 0.39\);连续性校正的 \(\chi^2\) 同样得到 \(p = 0.39\)。在未加权表上我们不拒绝等准确率的零假设;如报告,加权准确率为76.0%和77.2%。“统计平局”现在是一个统计陈述,而非修辞。
### 4.7 泛化:Mooij合成套件
Mooij合成套件[1 (https://arxiv.org/html/2606.23767#bib.bib1)]测试对受控噪声机制的泛化能力。我们在与SLOPE发行版捆绑的三个套件(SIM、SIM-G、SIM-ln;每套100对,方向平衡,强制决策)上以同条件方式运行所有方法。对于SLOPE,我们报告默认(plain)变体(用作会议基线)和SLOPER——期刊混合函数变体(mixedFunctions=T,nof=8),作者将其作为标题配置使用。
表 3:对真实图宾根对和三个Mooij合成套件(每套100对,强制决策)的同条件准确率。*粗体=行最大值。图宾根上加权,SIM-*上未加权(均匀权重)。*SLOPER是作者的期刊混合函数变体(mixedFunctions=T,nof=8);对于CEP,我们报告作者捆绑的sloper.tab输出(71.1% 加权强制),以与引用plain SLOPE(来自slope.tab的77.2%)的方式一致;对于SIM,我们报告在强制决策下相同Slope()函数的新运行,因为该包没有捆绑SIM输出。*
*两个发现*。(i) 两种SLOPE变体有相反的优势区间:plain在图宾根上获胜并在SIM上失败;SLOPER在SIM-ln上获胜但在图宾根上降至71.1%(比plain低6.1个百分点)。配置重要且正确的配置依赖于数据。(ii) 与plain SLOPE相比,我们在图宾根上是统计平局,并在所有三个合成套件上赢12-22个百分点。与SLOPER相比,我们在图宾根上赢+4.9个百分点,在SIM-G上赢+8,在SIM上平局,并在SIM-ln上输-13。跨两种变体,没有一个单一的SLOPE配置在图宾根上显著优于无参数压缩器。
## 5 超越决策
### 5.1 一个无模型混杂检测器——以及SLOPE不能做到这一点
在一个预先注册的模拟中(500个直接 \(X\to Y\) 对 vs. 500个混杂的 \(X \leftarrow H \to Y\) 对,边际匹配),分数**大小** \(\|s\|\) 将这两类分开相似文章
基于互兼容性的双变量因果陈述评估
本文提出了兼容性和不兼容性分数,用于评估双变量因果陈述集合,无需依赖忠实性假设,并通过分析大型语言模型的因果主张展示了其实用性。
证据类型竞争:干预数据何时能教会语言模型因果方向?
本文在受控的辛普森悖论世界中测试了预训练中增加干预数据是否能提升大语言模型的因果方向推理能力。研究发现,训练混合比例并不决定干预证据的使用,相反,推理时上下文中的证据类型才是决定性因素。
基于文本的因果推断方法:解析影响在线评价评分的多维因素
本文提出了一种基于文本的因果推断方法,通过改进的 CausalBERT 模型,解析各独立维度(如学校管理、学业表现)对在线评价总体评分的影响,并在超过 60 万条美国 K-12 学校评价数据上进行了验证。主要改进包括:温度缩放、超参数优化以及可解释性方法,以减少混淆偏差。
用于部分因果效应识别的最优实验
本文提出了“最大效力问题”,旨在选择受成本约束的实验,以最大程度地缩小部分因果效应的界限。作者提出了图形剪枝准则以减少搜索空间,并在NHANES健康数据集上展示了该方法的应用。
[R] CausalVLBench:大型视觉语言模型中视觉因果推理的基准测试。
这篇arXiv论文介绍了CausalVLBench,这是一个用于评估大型视觉语言模型中视觉因果推理的基准,涵盖三个任务:因果结构推断、干预目标预测和反事实预测。它在三个因果表示学习数据集上评估了开源LVLM,揭示了其优势与不足。