ReliableTableQA:可靠性标注需要多少监督?

arXiv cs.LG 论文

摘要

介绍 ReliableTableQA,一个用于训练大语言模型标注表格问答结果统计可靠性的框架,展示了小规模 SFT 数据集就足够,且 GRPO 仅在 SFT 训练不足时有帮助。

arXiv:2607.20537v1 发布类型:新 摘要:我们提出 ReliableTableQA,一个用于训练大语言模型标注表格问答结果统计可靠性的框架,关注的不是查询是否可回答,而是计算出的答案是否具有统计意义。在实际的企业数据分析中,语法正确的 SQL 查询可能返回基于过小样本、置信区间过宽或混杂因素过多而无法支持决策的值。现有系统在所有此类情况下都自信地给出答案,我们将这种失败量化为不可靠自信回答率(UCAR)。我们贡献了:(1)一个包含十个类别的可靠性分类体系(R1-R10),涵盖小样本聚合、多重比较膨胀和分布尾部不匹配等风险;(2)一个程序优先的数据流水线,通过基于公开零售模式的无上下文语法生成 50,000 个带有可靠性标签的训练样本,并进行了按模式分层的 SFT/GRPO 划分;以及(3)一项关于校准的可靠性标注实际需要多少监督的受控研究。我们发现,小型且按模式分层的 SFT 数据集效果显著:200 个样本将可靠性标志 F1 从 0.61 提升至 0.98,解析率从 0.52 提升至 1.00,将 UCAR 降至零,并得到一个能泛化到未见零售领域的模型(在留出的 H&M 数据集上 Rel-F1 为 0.997)。与这个强大的 SFT 基线相比,通常被认为必不可少的 GRPO 仅在 SFT 训练不足时有帮助(在 100 个样本时,精确标志集匹配提升 0.06-0.16,包括分布内和分布外),一旦 SFT 足够,GRPO 没有带来可测量的收益,这一零结果在困难的复合标志切片、严格精确匹配指标和分布外评估中得到了证实。我们的发现将可靠性标注重新定义为数据效率问题,并精确描绘了强化微调何时有效、何时无效。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:10

# ReliableTableQA:可靠性标注需要多少监督?
来源:https://arxiv.org/html/2607.20537
Huei\-Chung Hu DOCOMO Innovations, Inc\. heidi\.hu@docomoinnovations\.com &Hsin\-Tai Wu DOCOMO Innovations, Inc\. hwu@docomoinnovations\.com &Koyo Kobayashi NTT DOCOMO, Inc\. kouyou\.kobayashi\.gv@nttdocomo\.com

###### 摘要

我们提出了 ReliableTableQA,一个用于训练 LLM 标注表格 QA 结果*统计可靠性*的框架——这里关注的不是查询是否可回答,而是计算出的答案是否具有统计意义。在实际的企业分析中,一个语法正确的 SQL 查询可能会返回一个样本量太小、置信区间过宽或混杂因素过多而无法据此行动的值;现有系统在所有此类情况下都会自信地回答,我们将这种失败量化为*不可靠的自信回答率* (UCAR)。我们的贡献包括:(1) 一个十类可靠性分类体系 (R1–R10),涵盖了小样本聚合、多重比较膨胀、分布尾端不匹配等风险;(2) 一个程序优先的数据管道,通过基于公共零售模式的上下文无关语法生成了 50,000 个可靠性标注的训练样本,并进行了按模式分层的 SFT/GRPO 拆分;(3) 一项关于*校准的可靠性标注实际需要多少监督*的受控研究。我们发现,一个小型、按模式分层的 SFT 集就非常充分:200 个样本将可靠性标记 F1 从 0.61 提升至 0.98,将解析率从 0.52 提升至 1.00,将 UCAR 降为零,并且模型能够泛化到*未见过的*零售领域(在留出的 H&M 数据集上 Rel\-F1 为 0.997)。与这个强大的 SFT 基线相比,通常被认为至关重要的 GRPO——仅在 SFT 训练不足时才有用(在 100 个样本时,精确标记集匹配提升 +0.06–0.16,包括分布内和分布外的情况),一旦 SFT 充分,则没有任何可衡量的收益,这一零结果通过硬复合标记切片、严格精确匹配指标以及分布外评估得到了确认。我们的研究将可靠性标注重新定义为*数据效率*问题,并精确描述了强化微调在何时有效——以及何时无效。

## 1 引言

企业数据分析高度依赖表格问答:业务用户提出自然语言问题,LLM 生成 SQL,执行查询,然后返回答案。该流水线的主流评估范式衡量的是*执行准确率*——即 SQL 是否返回了正确的值 [18, 8]。这种框架将任何执行结果都视为同等可信。

但事实并非如此。假设有一个查询,计算某个县的客户平均智能手机使用分数,匹配行数为 n=3;或者一个顶级县排名,经过 38 个同时比较的 Bonferroni 校正后该排名反转;再或者一个聚合结果因空值而静默排除了 15% 的行。在这三种情况下,SQL 都是正确的:它已执行,返回了值,并且该值是匹配行的准确聚合。然而,这些结果中没有一个适合据此采取行动。当前的系统——无论是零样本 LLM 还是微调后的文本转 SQL 模型——都会以相同的置信度报告所有这三种情况。

我们形式化地将这种失败定义为*可回答性*与*可靠性*之间的差距。先前关于 LLM 回避的工作处理的是前者:模型是否应该因数据不存在、问题没有事实答案或 SQL 无法编写而拒绝回答 [6, 7, 2]?我们处理的是正交的维度:SQL 成功运行,数据存在,但*结果的统计性质使其具有误导性*。我们将这种模式称为*可回答但不可靠*,并引入*不可靠的自信回答率* (UCAR) 来衡量它。

#### 贡献。

- • 分类体系。十种可靠性风险 (R1–R10),涵盖小样本聚合、置信区间宽度、多重比较膨胀、缺失数据偏差、子组不平衡、单观测主导、辛普森反转风险、分布尾端不匹配、稀有事件比例以及交叉表稀疏性。每种风险都可以从已执行的查询结果中以程序化方式检测。
- • 管道。一种程序优先的数据生成方法,它颠覆了标准的 LLM 释义方法:一种上下文无关语法在真实零售模式上生成结构多样的 SQL 查询,一个确定性分析器分配多标签可靠性标注,然后一个 3B LLM 通过嵌入距离多样性过滤在顶层实现自然语言问题。这避免了简单的 LLM 驱动生成中的模式崩溃失败;附录 A 提供了语法、分析器规则和一个完整示例。
- • 强化学习何时有帮助?一项受控的 SFT 规模消融研究显示,校准的可靠性标注在很大程度上是一个*数据效率*问题。一个联合生成 SQL 答案*和*结构化可靠性评估的模型,首先通过 SFT 训练,然后进行 GRPO 训练,其奖励直接与 DuckDB 可执行的真实标签挂钩。我们发现几百个按模式分层的 SFT 样本就足够了,并且能迁移到未见过的领域,而 GRPO*仅*在 SFT 基础训练不足时才有帮助,一旦 SFT 充分就不再有任何贡献——这一结论在硬切片、严格精确匹配指标和分布外评估中均表现稳健。

在一个合成模式和两个公共零售模式(Synthetic Customer、Olist 巴西电商、Dunnhumby 家庭面板)、一个留出的第四个领域 (H&M) 以及更难的评估切片上的实验表明,一个数据高效的 SFT 模型将不可靠的自信回答降至零(UCAR = 0.000)并达到 0.98 的可靠性标记 F1,而零样本和仅提示基线分别以 5.5% 和 2.3% 的比率失败——并且 GRPO 的贡献仅限于训练不足的领域。图 1 展示了 ReliableTableQA 框架的所有三个组成部分。

请参见图注
图 1:ReliableTableQA 框架概述。(A) 数据生成:上下文无关语法(第 1 层)生成结构多样的 SQL 查询,确定性分析器(第 2 层)分配 R1–R10 可靠性标签,去重和平衡(第 3 层)产生一个 50K 的标注池,然后一个小型 LLM(第 4 层)实现自然语言问题。SynCust 是 Synthetic Customer 的缩写。(B) 微调:Qwen3-4B-Instruct 在一个小的按模式分层子集上(我们扫描 k 从 50 到 1000;GRPO 在 k=100 和 200 时运行)进行 SFT 训练,然后在另一个不重叠的拆分(SFT 大小的 20 倍)上进行 GRPO 训练,使用三个 DuckDB 可执行的奖励信号,无需奖励模型。(C) 推理:微调后的模型生成 SQL,执行它,提出适用的可靠性标记 (R1–R10),并决定是回答还是回避。我们的数据高效 SFT 模型在各个模式上实现了 UCAR = 0.000 和 Rel-F1 ≈ 0.98(在留出的 H&M 领域上为 0.997),而 GRPO 仅在 SFT 训练不足时才带来可衡量的收益。

## 2 问题形式化

#### 设定。

令 T 为一个关系表,q 为一个自然语言问题。表格 QA 系统产生一个响应 r = (d, s, f, e),其中:d ∈ {answer, abstain} 是一个决策,s 是一个 SQL 查询,f ⊆ {R1, ..., R10} 是一组可靠性标记,e 是一个自然语言的可靠性解释。

#### 可靠性分析器。

给定 s 和 T,确定性分析器 φ 执行 s 并计算一个二值可靠性向量 φ(s, T) ∈ {0, 1}^10,每个条目对应一种风险(表 1)。如果没有任何风险触发,则结果是*可靠的* (f = ∅);否则是*不可靠的*,标签集 L = {Ri : φi = 1}。

#### 评估指标。

我们从五个维度评估系统:

- • Rel-F1:预测标记 f 与真实标签 L 之间的微 F1,按记录平均。
- • UCAR:在 L ≠ ∅ 的记录中,模型输出 d=answer、f=∅ 且 confidence=high 的比例。越低越好;0.0 表示模型从未在不标记的情况下自信回答不可靠的查询。
- • 回答准确率:模型的 SQL 在执行时,其输出结果是否与黄金 SQL 的输出匹配。
- • SQL 合法性:模型的 SQL 是否能无错误执行。
- • 回避准确率:模型的决策 d 是否与真实标签中的回避/回答标签匹配。真实标签中的 abstain 仅在 R1 在硬阈值 (n < 5) 下触发时出现;对于 5 ≤ n < 30 的查询,R1 作为警告触发,但 ground-truth 决策仍为 answer。

## 3 可靠性分类体系

表 1 定义了十种可靠性风险。每种风险都可以从查询结果中检测,无需访问外部知识:只需要已执行的行、组大小和列统计信息。这是有意为之——系统必须作为执行后的标注器运行,而不是执行前的过滤器。

表 1:十种可靠性风险 (R1–R10)。每种风险都从已执行的查询结果中以确定性方式计算。一个查询可以同时触发多种风险。该分类体系植根于经典统计实践——这些失败模式出现在小样本推断、多重检验和探索性数据分析的教科书论述中 [4, 16]。我们将它们形式化为表格 QA 的一个*可学习、可评估的标签空间*:可以训练模型从用户的问题和分析器统计数据中预测 φ(s, T),并通过与真实标签的 F1 进行评估。

## 4 数据管道

构建可靠性标注的训练集需要能够*密集覆盖*所有十类风险的查询,包括罕见的类型如 R3(多重比较膨胀)和 R8(分布尾端不匹配)。简单的 LLM 驱动的问题生成在此任务上失败:当被提示生成多样化的分析问题时,模型会坍缩到高频模板(例如,“有多少客户在 X 州?”),这些模板过度代表常见模式,而低估了像 R3 和 R8 这样的稀有结构性风险。我们颠倒了依赖关系(附录 A 详细介绍了语法、确定性分析器规则和一个完整的端到端示例)。

#### 第 1 层:基于 CFG 的 SQL 生成。

一种针对每个模式的上下文无关语法生成 SQL 查询,这些查询在聚合类型(AVG, MEDIAN, SUM, MAX, MIN, STDDEV, P90, P10, COUNT, COUNT DISTINCT, RATIO)、分组依据元数(0, 1, 2)、谓词数量(0–3)和输出基数桶(1, 2–10, 11–50, 51+)方面具有组合结构覆盖。字面值(例如,分类过滤值、数值阈值)从每个表的实际列分布中采样。我们丢弃结果基数为零或输出平凡常量的查询。

#### 第 2 层:可靠性分析器。

每个查询通过 DuckDB 针对其表执行。一个确定性分析器从结果集计算完整的 R1–R10 信号向量,并分配多标签标注。该分析器用纯 Python 实现,不需要外部 API(自助法 CI 使用 B=1000 次重采样;BH-FDR 使用 Benjamini-Hochberg 过程 [1])。

#### 第 3 层:去重和平衡。

我们通过抽象数值和字符串字面量将查询折叠为结构模板,然后每个模板采样一个代表。自然发生频率低的标签(R3, R8)在 NL 生成之前被过采样到每个标签至少 3,000 个实例。

#### 第 4 层:NL 问题实现。

一个 3B 指令微调的 LLM (Qwen2.5-3B-Instruct [12]) 每个查询使用五种角色类型(业务分析师、数据科学家、产品经理、执行人员、技术操作员)生成两个自然语言问题变体。一个贪婪的嵌入距离过滤器 (all-MiniLM-L6-v2) 移除与每个批次内先前接受的问题过于相似的变体 (cos > 0.85)。

#### 第 5 层:组合与拆分。

我们每个模式生成 30,000 个查询(Synthetic Customer, Olist, Dunnhumby),应用 NL 生成,然后按模式分层采样 50,000 条记录作为训练集。在 NL 生成之前留出三个各 500 条记录的测试集,并使用基于模板的问题替代进行评估。表 2 汇总了标签分布。

表 2:训练集中每个模式的可靠性标签分布(总计 50k)。标签是多热的;行不总和为 100%。R4 在 Olist 和 Dunnhumby 中不存在,因为它们的扁平化表在连接列中没有缺失值。由于零售模式中重尾支出分布,R8 自然丰富。SynCust 是 Synthetic Customer 的缩写。

## 5 模型

### 5.1 输出格式

模型生成一个结构化 JSON 响应,包含以下字段:decision (answer/abstain)、sql(可执行的 DuckDB SQL)、result(一行摘要)、reliability_flags(R1–R10 标记名称的子集)、reliability_explanation(一到两句引用具体统计数据的解释)、confidence(high/medium/low)和 evidence(来自分析器的关键数值)。

模型接收表描述、自然语言问题和完整的分析器统计数据块(组大小、CI 宽度、空值率等)作为输入上下文。模型基于给定的分析器统计数据标注可靠性,而不是从原始数据重新计算。

### 5.2 阶段 1:监督微调

我们使用 LoRA(秩 16,α=32,所有投影模块)通过 TRL 的 SFTTrainer [17] 对 Qwen3-4B-Instruct-2507 [13] 进行微调。训练目标是仅在助手轮次上的下一个词预测(响应掩码损失)。我们不使用完整的 50k 池进行训练,而是抽取一个大小为 k 的小型*按模式分层*子集(在十种风险和各模式之间平衡),并以有效批次大小 16(微批次 2,梯度累积 8)训练 3 个 epoch。正是这个大型、多样化的池使得这种分层成为可能——每个(风险,模式)单元格,包括像 R3 和 R8 这样的稀有类型,都有足够的候选者来采样一个平衡的子集——因此下面的数据效率结果是关于训练数据*如何选择*的发现,而不是反对生成它的论点。我们报告 k=100 (S1) 和 k=200 (S2),最终训练损失分别为 1.16 和 0.68。如第 6 节所示,更大的集合让模型能够可靠地发出其结构化输出格式;SFT 阶段同时教授了格式以及从分析器统计数据到可靠性标记的确定性映射。

### 5.3 阶段 2:GRPO 微调

在合并的 SFT 权重之上,我们应用了群体相对策略优化 (GRPO) [15],并研究其贡献如何随 SFT 充分性变化。我们使用三个确定性的、DuckDB 可执行的奖励函数(无学习到的奖励模型);所有函数均预先加权并由 TRL 求和:

- • 回答正确性 (+0.30): 生成的 SQL 对表执行,其结果与黄金 SQL 输出进行比较,使用精确匹配或对标量值使用 1% 的相对容差。
- • 可靠

相似文章

当无基准存在时:验证无真实标签的LLM安全评分比较

Hugging Face Daily Papers

本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。

TabularMath:用大语言模型理解表格上的数学推理

arXiv cs.CL

TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。