马尔可夫边界在表格预测中的好、坏与丑

Hugging Face Daily Papers 论文

摘要

本文评估了马尔可夫边界在表格预测中的实际效果,发现尽管理论上最优,但由于计算限制和优化目标不匹配,当前的因果发现方法无法持续提升预测性能。

在标准图假设下,目标变量的马尔可夫边界是最小的特征集合,它使得所有其他特征变得多余。一旦观察到该边界,目标变量与表格中其余部分条件独立。这对于表格预测来说是一个诱人的对象,因为它准确地指明了模型所需的列。然而,现代回归器仍然在完整特征集上训练。我们探究马尔可夫边界在SCM3K上的预测是否真正有用。SCM3K是一个包含3450个任务的合成SCM基准,特征数量从40到1000,涵盖六种SCM族,并使用六种回归器进行评估。答案比理论所暗示的更加微妙。将回归器限制在理想边界上通常会大幅提升预测性能,并且随着特征空间变得更大更稀疏,这种提升也会增加。但是,通过因果发现恢复边界并在恢复的掩码上进行训练的这一自然流程并不奏效。现有的估计方法在达到边界最有效的区域之前就已经耗尽了计算预算,即使在能够运行的情况下,它们也很少能超过完整特征集。我们将此归因于三个原因。发现过程优化的是结构恢复而非预测表现。假阴性和假阳性带来的预测代价极不对称。精确的边界只是众多优于全部特征的集合之一。随后,我们探讨这些事实对与预测对齐的特征选择以及学习利用因果结构的表格模型的意义。
查看原文
查看缓存全文

缓存时间: 2026/06/01 07:18

论文页面 - 马尔可夫边界在表格预测中的好、坏与丑

来源:https://huggingface.co/papers/2605.29411 发布于 5月28日

·

由https://huggingface.co/Shuwan 提交

Shu (https://huggingface.co/Shuwan) 于 6月1日

摘要

该研究考察了马尔可夫边界在表格预测中的实际有效性,发现尽管理论上最优,但当前的因果发现方法由于计算限制和优化目标不匹配,未能持续提升预测性能。

在标准图假设下,目标变量的马尔可夫边界(https://huggingface.co/papers?q=Markov%20boundary)是使其他所有特征都变得冗余的最小特征集。一旦观察到该边界,目标变量与表格中的其余变量条件独立。这对于表格预测(https://huggingface.co/papers?q=tabular%20prediction)来说是一个极具吸引力的对象,因为它精确指出了模型所需的列。然而,现代回归器仍然是在完整特征集上训练的。我们探究马尔可夫边界(https://huggingface.co/papers?q=Markov%20boundary)是否真的对 SCM3K(一个包含 3450 个任务的合成 SCM 基准测试,特征数从 40 到 1000,涵盖六个 SCM 家族)上的预测有用,并采用六种回归器进行评估。答案比理论要复杂得多。将回归器限制在理想边界上通常能显著提升预测性能,且特征空间越大、越稀疏,提升幅度越大。然而,通过因果发现(https://huggingface.co/papers?q=causal%20discovery)恢复边界并在恢复的掩码上训练这一自然流程并不可行。现有估计器在达到边界最能发挥作用的区域之前就已耗尽计算预算,即便在可运行的场景下,它们也很少能超越完整特征集。我们将此归因于三个原因:因果发现优化的是结构恢复(https://huggingface.co/papers?q=structural%20recovery)而非预测;假阴性和假阳性带来的预测代价严重不对称;精确边界只是众多能击败全特征集的特征集之一。我们随后阐述了这些事实对于面向预测的特征选择(https://huggingface.co/papers?q=feature%20selection)以及学会利用因果结构的表格模型意味着什么。

查看 arXiv 页面 (https://arxiv.org/abs/2605.29411)查看 PDF (https://arxiv.org/pdf/2605.29411)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29411)

在您的 Agent 中获取此论文:

hf papers read 2605.29411

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

无模型与此论文关联

在模型 README.md 中引用 arxiv.org/abs/2605.29411 即可从此页面建立链接。

引用本论文的数据集0

无数据集与此论文关联

在数据集 README.md 中引用 arxiv.org/abs/2605.29411 即可从此页面建立链接。

引用本论文的 Spaces0

无 Space 与此论文关联

在 Space README.md 中引用 arxiv.org/abs/2605.29411 即可从此页面建立链接。

包含本论文的合集0

无合集包含本论文

将此论文添加至一个合集 (https://huggingface.co/new-collection) 即可从此页面建立链接。

相似文章

表格上下文学习器能否泛化到生物分子性质预测?

arXiv cs.LG

本文研究了在合成因果表上预训练的表格上下文学习模型能否从有限的标注数据泛化到生物分子性质的预测。作者发现,这些模型在蛋白质适应性回归任务上具有竞争力,但在小分子分类中,表示选择至关重要。

反事实行为的几何视角:决策边界接近性与局部数据支撑的交互作用

arXiv cs.LG

本文通过几何视角审视机器学习模型中的反事实行为,表明预测性能相似的模型,由于决策边界接近性与局部数据支撑之间的交互作用,其反事实结果可能大相径庭。研究结果将反事实行为视为与预测性能不同的独立维度,对模型选择及反事实解释方法的可靠性具有启示意义。