统计上不可区分,操作上截然不同:表格基础模型的正式障碍

arXiv cs.LG 论文

摘要

本文提出了一个正式的不可能性结果,表明表格基础模型无法区分合法与违反规则的数据库状态,除非能够访问操作规则。该结果通过操作图灵测试(OTT)和实证实验得到了验证。

arXiv:2606.29091v1 Announce Type: new 摘要:表格基础模型无法推理由运行系统产生的数据,除非能够访问控制这些系统的规则。我们使这一陈述具备可证伪性。\emph{操作图灵测试}(OTT)构建合法与违反规则的数据库状态对,其$1$-和$2$-维列-值边际分布的总变差匹配至小于$0.02$;然后Le Cam引理将任何仅基于值的分类器的贝叶斯误差下界设为$\geq0.49$。三个仅基于值的基线模型(XGBoost、TabICL、TabPFN)恰好达到该下界(准确率$0.50$,预先注册的双单侧检验(TOST)$p<0.002$),原始行级访问无帮助,暴露关系值一致性缩小了大部分差距,只有由七个可执行规则派生审计提供输入的分类器达到$1.00$的分类准确率。在三次匹配的$100$-状态前沿大型语言模型(LLM)运行中,给定模式、触发器源、规则表和状态文件的模型最多将$2/50$的合法状态分类为LEGAL;GPT-5.5即使使用更高推理努力和结构化查询语言(SQL)执行器,也接受$0/50$的合法状态。访问阶梯模式也出现在具有结构上不同规则族的第二个模式上(银行账本:跨行余额、累计汇总)。障碍在于可识别性,而非容量:规模、数据和更丰富的特征在没有操作基础的情况下无法跨越它。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:31

# 表格基础模型的形式化屏障
来源:https://arxiv.org/html/2606.29091
## 统计不可区分,操作上截然不同:表格基础模型的形式化屏障

###### 摘要

表格基础模型无法对由运行中的系统产生的数据进行推理,除非能访问控制这些数据的规则。我们使这一论断变得可证伪。*操作图灵测试* (Operational Turing Test, OTT) 构造了合法与违反规则的数据库状态对,其1-维和2-维列值边缘分布的总变差距离 <0.02;根据Le Cam引理,任何仅基于值的分类器的贝叶斯误差 ≥0.49。三个仅基于值的基线模型(XGBoost、TabICL、TabPFN)精确地达到了这一界限(准确率0.50,预先注册的双单侧检验 (TOST) p<0.002),原始的行级访问也无济于事,暴露关系值一致性填补了大部分差距,只有由七个可执行的规则派生审计驱动的分类器达到了1.00的分类准确率。在三个匹配的100状态前沿大型语言模型 (LLM) 运行中,给定模式、触发器源代码、规则表和状态文件的模型最多将2/50的合法状态分类为LEGAL;即使有更高的推理努力和结构化查询语言 (SQL) 执行器,GPT-5.5也未能接受0/50的合法状态。这种访问阶梯模式也出现在具有结构上不同的规则族(银行分类账:跨行平衡、累积聚合)的第二个模式上。屏障在于可识别性,而非能力:规模、数据和更丰富的特征无法在缺乏操作基础的情况下跨越它。¹¹代码和数据:github.com/SAP-samples/operational-turing-test (https://github.com/SAP-samples/operational-turing-test)。

表格基础模型、操作基础、不可能性结果、基准

\\icmlshowauthorstrue

存储值 连接 分组 规则 审计 完整 oracle 概念阶梯 控制 RDB SQL oracle .50 .75 1.00 .50 .89 1.00 1.00 准确率 经验证据 图1:访问阶梯和经验验证。左:概念访问级别。右:代表性证据;虚线为随机水平。泄露控制保持在随机水平;关系基线 (HistGB/RDB-PFN, Wang等, 2026 (https://arxiv.org/html/2606.29091#bib.bib16)) 达到0.89但遗漏了推导;源自模式和代码的SQL审计与oracle匹配。

## 1 引言

表格基础模型在单一、自包含表格的基准测试上取得了快速进展。生产环境中的表格则不同:应用程序代码写入行,声明性约束限制值,过程性触发器强制执行转换,业务规则决定哪些状态是合法的。因此,模型可用的训练数据是运行系统的投影:存储的值保留下来,但生成这些值时的大部分操作逻辑和过程都被遗忘了。

这种解耦在企业系统中很严重。大型模式暴露了数千个包含技术标识符的表格,其语义存在于数据定义语言 (DDL) 之外;诸如`BUKRS`、`MATNR`或`VBAK-ERDAT`这样的列名十分典型,以至于自动列名扩展现在被研究为处理此类表格的前提条件 (Zhang等, 2023 (https://arxiv.org/html/2606.29091#bib.bib18))。最近的跨表 (Kim等, 2024 (https://arxiv.org/html/2606.29091#bib.bib11))、关系型 (Fey等, 2024 (https://arxiv.org/html/2606.29091#bib.bib9); Robinson等, 2024 (https://arxiv.org/html/2606.29091#bib.bib10); Wang等, 2025 (https://arxiv.org/html/2606.29091#bib.bib12)) 和数据库原生 (Wehrstein等, 2025 (https://arxiv.org/html/2606.29091#bib.bib13)) 基础模型使关系层变得可摄入了。其上的操作层发展较少:模式文本中的值域和参照完整性,加上触发器、验证脚本和应用程序代码中的过程性规则。本文使由此产生的不可区分性屏障变得可证伪,并测试前沿LLM提示中的源工件是否能关闭它。

#### 阅读阶梯。

图1 (https://arxiv.org/html/2606.29091#S0.F1) 不是模型类别的排行榜。灰色条是泄露控制的合理性检查:当匹配状态保留可观察的值统计时,仅基于值的模型和原始行变体应保持在随机水平。关系特征添加了连接、键覆盖和分组计数;规则派生审计则重新计算合法性谓词,例如根据订单项、折扣和税费重新计算存储的总计。

#### 操作图灵测试。

我们将“操作上下文”具体视为决定数据库状态是否合法的一组规则:值域约束、值转换逻辑、关系值一致性(参照完整性)和值状态转换约束。*操作图灵测试* (OTT) 将这一思想概括为统计观察在没有操作规则的情况下不足的测试 (Klein and Hoffart, 2026 (https://arxiv.org/html/2606.29091#bib.bib15));这里我们将其实例化为一个二分类任务,针对(合法、非法)状态对,其中违反规则的损坏将1-维和2-维列值边缘分布保持在总变差距离 (TV) τ=0.02 以内。Le Cam引理给出了一个贝叶斯误差上界,为 ½ − τ/2 ≥ 0.49,适用于任何输入限于此类统计的分类器(命题1 (https://arxiv.org/html/2606.29091#Thmproposition1))。来自两个广泛架构族(梯度提升树和transformer)的仅基于值的基线模型,在预先注册的双单侧检验 (TOST) 等价性程序下¹²,准确率在统计上等同于随机水平 (Lakens, 2017 (https://arxiv.org/html/2606.29091#bib.bib3), α=0.05);七个可执行的规则派生审计将差距缩小到1.00的分类准确率。

¹²TOST等价性裕度 δ=0.02 和种子分配在评估前已注册。

#### 发现。

1. 1. 在边缘匹配条件下,操作基础在*信息论上是必要的*(命题1 (https://arxiv.org/html/2606.29091#Thmproposition1))。
2. 2. 屏障与*架构、规模和表示无关*:三种基线模型和原始行都达到了Le Cam界限(第4节 (https://arxiv.org/html/2606.29091#S4))。
3. 3. 暴露关系值一致性填补了大部分差距,但*无法恢复值转换逻辑*(表1 (https://arxiv.org/html/2606.29091#S4.T1))。
4. 4. 带有提示内完整源工件的前沿推理模型*未能通过测试*(第5节 (https://arxiv.org/html/2606.29091#S5))。

## 2 操作图灵测试

#### 设定。

现实世界中的表格并非孤立存在;它们是由运行系统写入的行,而控制该系统的规则有两种。*声明性规则*(类型、值域约束和关系值一致性(如参照完整性))写入模式文本。*过程性规则*(值状态转换约束、值转换逻辑和每个聚合的基数界限)存在于触发器和应用程序代码中。我们将两者的并集记为规则集 Π。剥离了 Π 的数据集保留了值,但丢失了生成这些值的大部分操作逻辑和过程。

将 φₖ(S) 写为数据库状态 S 的所有 k-维列值边缘分布的向量,如果分类器的输入是某个有限 k 的 φₖ(S)(因此它无法访问读取 Π 的查询),则称其为*仅基于值的*分类器。令 P_legal 和 P_illegal 分别为来自合法数据生成过程和来自违反 Π 中单个规则但保持其他处值的损坏过程中的状态分布。

###### 命题1(操作基础的必要性)。

如果 ‖φₖ(P_legal) − φₖ(P_illegal)‖_TV ≤ τ,那么任何仅基于值的分类器的贝叶斯误差 ≥ ½ − τ/2。

这是Le Cam引理 (Le Cam, 1973 (https://arxiv.org/html/2606.29091#bib.bib1); Tsybakov, 2009 (https://arxiv.org/html/2606.29091#bib.bib2)):总变差距离在 τ 以内的两个分布,其贝叶斯误差不能优于 ½ − τ/2。我们的构造强制执行 τ < 0.02(第3节 (https://arxiv.org/html/2606.29091#S3)),因此得到 ≥ 0.49。这个界限是一个*存在性/不可能性*结果。失败是基于可识别性,而非基于能力,因此更大的模型、更多的数据和更丰富的特征无法逃脱它;我们通过行级访问的经验验证了后者(第4节 (https://arxiv.org/html/2606.29091#S4))。我们并不声称每个表格基础模型在每个任务上都失败,只声称当这一条件成立时,规则引导的查询是必要的。

## 3 构造

#### 模式。

我们在一个三表订单到现金模式(客户、订单、订单项)上实例化测试,这是标准企业销售流程的结构核心。该模式特意保持最小化以保证透明性;完整的模式定义以及触发器和应用程序代码规则见第A.1节 (https://arxiv.org/html/2606.29091#A1.SS1)、第A.2节 (https://arxiv.org/html/2606.29091#A1.SS2) 和第A.3节 (https://arxiv.org/html/2606.29091#A1.SS3),并且该构造可以推广到任何规则可表述为可执行代码的模式。大规模的现实世界关联业务表格语料库已经可用 (Klein等, 2024 (https://arxiv.org/html/2606.29091#bib.bib8))。

#### 规则与损坏。

四类操作规则支配合法状态;只有部分存在于模式文本中。对于每一类,我们给出位置、实例和一种单规则损坏,该损坏将每个1-维和2-维列值边缘分布保持在 τ < 0.02 以内:

- (i) *关系值一致性*(声明性,模式)。`orders.customer_id` 必须出现在 `customers.id` 中。`fk_break` 将约 5% 的值替换为未见过的ID。代理键符号从 φₖ 中排除,使得仅基于值的视图对任意的ID重命名保持不变;检查子键是否出现在父表中则是一个可执行的关系审计,因此对于仅基于值的视图,TV=0。
- (ii) *基数一致性*(混合;模式中每行 `quantity > 0`,应用程序代码中每聚合有界限)。每个订单 ≤ 20 个项,每个客户 ≤ 3 个未结订单。`cardinality_break` 将订单项重新分配到同一客户的不同订单,保持 `quantity` 和 `unit_price` 不变;重新计算订单总额以与重新分配的项保持一致,因此值转换逻辑继续成立。
- (iii) *值转换逻辑*(过程性,应用程序代码)。`line_total = qty · unit_price · (1 - discount(tier, qty))` 且 `order.total = (∑ line_total) · (1 + tax(country))`。`derivation_break` 向 `orders.total` 添加小的偏移量,这些偏移量在各个订单之间抵消(约为列均值的 0.1%,总和为零),因此列直方图基本不变(TV ≈ 0.001–0.003),但总额不再匹配公式。
- (iv) *值状态转换*(过程性,触发器代码;第A.2节 (https://arxiv.org/html/2606.29091#A1.SS2))。`(prev_status, status)` 必须位于一个四元素允许集合中(例如 `pending → shipped`)。`transition_break` 交换一个 `delivered` 和一个初始 `pending` 订单的 `status`;`status` 的1-维边缘分布被精确保留。

所有四种损坏都通过了置换空值检验(p=1.000);损坏策略总结于第A.4节 (https://arxiv.org/html/2606.29091#A1.SS4)。

#### 特征。

*仅基于值*的特征向量是一个35维的列级统计摘要:均值、标准差、四分位数、熵、众数频率以及两个预先指定的跨列相关性。设计上排除了任何组大小统计,并验证了在 `order_id` 置换下不变(最大差异=0)。*操作基础的*分类器通过七个可执行的规则派生审计(完整列表见第A.5节 (https://arxiv.org/html/2606.29091#A1.SS5))的标量输出来增强这个向量:孤立外键计数(两个)、基数违规计数(两个)、行总额和订单总额值转换的最大绝对残差(两个)以及非法转换计数。对于值转换逻辑,审计并不读取隐藏的违规标签:它根据数量、价格、折扣和税费重新计算预期的行总额和订单总额,然后与存储的总额进行比较。每个审计都是针对模式以及触发器或应用程序代码的单个SQL查询;无法访问 Π 的模型无法构造它。

#### 仅基于值的合理性基线与规模。

我们测试两个广泛架构的三个仅基于值的基线:梯度提升树,由XGBoost (Chen and Guestrin, 2016 (https://arxiv.org/html/2606.29091#bib.bib4)) 代表;以及基于transformer的表格模型,由TabICL (Qu等, 2025 (https://arxiv.org/html/2606.29091#bib.bib6)) 和TabPFN v1 (Hollmann等, 2023 (https://arxiv.org/html/2606.29091#bib.bib5)) 代表。这些基线用于检查仅基于值框架内的泄露、有限样本伪影和表示效应;根据命题1 (https://arxiv.org/html/2606.29091#Thmproposition1),它们不被期望解决该任务。该框架内的改进(TabPFN的Nature版本 (Hollmann等, 2025a (https://arxiv.org/html/2606.29091#bib.bib20))、TabPFN-2.5 (Hollmann等, 2025b (https://arxiv.org/html/2606.29091#bib.bib21)))无法逃脱它;我们使用v1,因为失败模式是信息论性质的,而非能力受限。一个操作基础的XGBoost使用相同的35维向量,并增加了七个可执行审计的输出;一个oracle直接执行规则并作为上界。训练:每个种子1,000个标记的(合法、非法)对;测试:500个保留对;5个种子;每个状态200个客户。

## 4 结果

发现。• 与架构无关的失败:XGBoost、TabICL和TabPFN在TOST下均处于随机水平(p<0.002)。• 与表示无关的失败:行级访问在所有四种违规上也达到0.50。• 关系值一致性不足:具有关系特征的树和PFN模型在值转换逻辑上的召回率 ≤ 0.02。• 可执行规则派生审计填补了差距:操作基础和oracle达到1.00。• 给定源工件的LLM:匹配的100状态运行最多将2/50的合法状态预测为LEGAL。

#### 架构间的随机水平。

所有三个仅基于值的模型在预先注册的TOST等价性检验下 (Lakens, 2017 (https://arxiv.org/html/2606.29091#bib.bib3), α=0.05) 在统计上等同于随机水平,误差在 ±2 个百分点内:XGBoost **0.5014** (p=0.0018),TabICL **0.5006**,TabPFN **0.5012** (两者 p<10⁻⁴);见图1 (https://arxiv.org/html/2606.29091#S0.F1)。操作基础的XGBoost达到 **1.00**,oracle达到1.00。仅基于值的模型在每个违规上的召回率与随机猜测一致,且两个架构上距离最远的基线(XGBoost, TabICL)的错误基本不相关(Pearson φ = −0.076),排除了共享的已利用信号。

相似文章

超越IID:表格基础模型到底有多通用?

Hugging Face Daily Papers

本文介绍了BeyondArena,一个统一的表格数据整体基准,并发现现有的表格基础模型仅在小到中等规模的IID数据上表现优异,而传统的基于树和深度学习模型仍然在非IID、大规模和高维数据集上占据主导地位。

TabularMath:用大语言模型理解表格上的数学推理

arXiv cs.CL

TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。

用于离散选择估计的表格基础模型

arXiv cs.LG

本文提出一种重新表述方法,将表格基础模型(TFMs)应用于离散选择估计,解决了行独立假设的结构性差距。最佳重新表述在留出对数似然上优于层次贝叶斯估计8%,在命中率上优于3.6%,同时运行速度快16倍。