SemPlan:针对企业数据的基于大语言模型查询的结构化语义规划基准测试

arXiv cs.AI 论文

摘要

SemPlan是一个用于评估基于大语言模型查询中结构化语义规划的基准测试,使用包含1,800个案例的合成双语数据集比较四种架构。

arXiv:2608.13612v1 公告类型:新 摘要:自然语言接口到企业数据必须将不明确的请求转换为受治理的、可执行的行为,同时控制无效查询、策略失败、成本和不确定性。SemPlan基准测试通过一个包含1,800个英语和巴西葡萄牙语案例的确定性合成双语基准来评估这一架构设计空间;其中1,200个案例构成冻结的科学评估子集。在相同模型配置下比较了四种架构:直接SQL生成(A1)、有界工具代理基线(A2)、结构化语义请求生成后接确定性规划和执行(A3),以及澄清/有状态语义规划变体(A4)。在4,800个主要记录中,答案正确性绝对值较低:A1为22.25%,A2为22.58%,A3为25.67%,A4为24.25%。A3具有最高的观察正确性,并在预指定的配对正确性分析中显著超过A1、A2和A4,而A1保持了最高的策略正确率和最低的不安全或无效率。A4具有最低的平均API成本和最低的错误拒绝率。在预选的150个案例稳定性子集上,答案正确重复性范围从92.00%到98.67%。结果支持一种权衡解释而非普遍排名:额外的结构约束改变了失败模式和效率,但并未单调提高正确性或解决歧义和多轮状态一致性问题。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:44

# 面向企业数据LLM查询的结构化语义规划基准测试  
来源:https://arxiv.org/html/2608.13612  

## SemPlan:面向企业数据LLM查询的结构化语义规划基准测试  
致谢:生成式AI工具协助了实验软件流程的开发与调试。作者负责研究设计、验证、分析及科学主张。  

Bruno Santos Teixeira  
所属机构:巴西联邦奥鲁普雷图大学(UFOP)  
ORCID:0009-0007-3860-7114(https://orcid.org/0009-0007-3860-7114)  

###### 摘要  

面向企业数据的自然语言接口必须将未明确指定的请求转化为受管控的可执行行为,同时需控制无效查询、策略违规、成本及不确定性。SemPlan基准测试通过一个确定性的合成双语基准评估这一架构设计空间,该基准包含1,800个英语和巴西葡萄牙语案例;其中1,200个案例构成固定的科学评估子集。在相同模型配置下,对比了四种架构:直接SQL生成(A1)、受限工具代理基线(A2)、结构化语义请求生成后接确定性规划与执行(A3)、以及带澄清/状态语义规划的变体(A4)。在4,800条主记录中,答案正确率在绝对值上均较低:A1为22.25%,A2为22.58%,A3为25.67%,A4为24.25%。A3观测到最高正确率,在预设的配对正确性分析中显著优于A1、A2和A4;而A1保持了最高的策略合规率与最低的不安全/无效查询率。A4则具有最低的平均API成本和最低的错误拒绝率。在预选的150个案例稳定性子集中,答案正确可重复性介于92.00%至98.67%之间。研究结果支持权衡解释而非普适性排名:额外的结构约束改变了故障模式与效率,但未单调提升正确性,也未解决语义模糊与多轮状态一致性的问题。  

## 1 引言  

自然语言数据库访问长期以来致力于为不编写查询语言的用户提供结构化数据访问能力。然而,核心难点不仅在于生成语法有效的SQL。企业分析问题通常涉及业务指标、隐含维度、时间范围、授权边界、不支持的操作及对话上下文。因此,系统可能在语法正确的情况下仍存在语义错误、策略不一致或操作无效的问题。早期的自然语言数据库接口已识别出歧义性、领域建模和可移植性作为持续关注点;现代基准测试(如Spider、SParC、CoSQL和BIRD)在跨领域、对话式和数据库相关场景下重新审视了这些问题。  

当前基于LLM的系统对模型责任的分配存在差异。一种极端是模型直接生成SQL。其他设计则要求模型选择工具、生成类型化语义表示,或与确定性归一化与执行层交互。这些选择常被讨论为工程偏好,但它们也定义了不同的实证假设,即错误产生的根源以及哪些约束能提升可靠性。  

SemPlan在固定模型、基准案例、数据库快照和评估规则的前提下研究这一设计空间。核心问题是:*在LLM驱动的企业数据查询中,不同形式和程度的结构约束如何在答案正确性、策略行为、故障模式、成本及可重复性之间进行权衡?* 本研究有意限定范围,不涉及生产就绪性主张。它使用独立生成的合成企业领域数据,未使用客户或专有数据。  

本文贡献如下:首先,提出了用于受控评估LLM驱动结构化企业数据查询的双语合成基准。其次,在统一实验配置下对比四种架构模式,而非比较不同模型家族。第三,报告了关于答案正确性、策略行为、类型化故障结果、成本、歧义性、多轮状态一致性和可重复性的配对证据。第四,提供了基于固定提示、清单、原始输出哈希、评分记录、生成表格图表及无需密钥验证路径的可复现性套件。  

## 2 相关工作  

自然语言数据库接口早于当前LLM系统,历史上依赖语法、解析、语义表示、领域约束和特定于模式的转换。现代文本到SQL研究转向跨领域评估。Spider通过训练集与测试集间不同的数据库和查询结构建立了具有挑战性的场景。SParC将任务扩展至上下文交互,而CoSQL添加了澄清和不可回答请求等对话现象。BIRD进一步强调大规模数据库内容、外部知识和效率。  

第二条研究路线通过中间结构或约束解码来减少语言与可执行SQL之间的差距。IRNet在确定性SQL推断前使用模式链接和SemQL中间表示。RAT-SQL强调关系感知的模式编码与链接。执行引导解码利用执行反馈过滤候选方案,而PICARD在生成过程中增量拒绝不被允许的token。这些方法支持了形式化约束可减少部分无效输出的大原则,但并不意味着额外约束总能提升端到端任务正确性。  

工具使用语言模型系统代表了另一类架构。ReAct交替进行推理和行动,而Toolformer研究模型如何决定何时以及如何调用外部API。当前的API系统中,结构化输出和函数调用机制可将模型响应或工具参数约束至模式。SemPlan与这些工作互补:它并非提出单一解码技术,而是评估LLM与确定性软件组件间责任分配的四种端到端架构。  

基准设计也遵循更广泛的复现性原则,即数据集应传达动机、组成、生成方式、预期用途和局限性。因此,SemPlan将合成数据生成、基准生成、人工审查、黄金执行、模型执行和派生统计工件分离。  

## 3 研究问题与预设假设  

本研究围绕五个研究问题进行冻结。  
- **RQ1** 询问A1–A4在双语企业分析问题上的最终答案正确性差异。  
- **RQ2** 询问它们在无效执行、执行失败及策略相关结果方面的差异。  
- **RQ3** 询问产生的成本和延迟权衡。  
- **RQ4** 询问正式澄清是否能改善实质模糊问题上的行为。  
- **RQ5** 询问结构化状态是否能提升PATCH/REPLACE后续操作的一致性。  

在隐藏评估前,方向性假设预期语义规划方法相比直接SQL能提升语义与答案正确性;能减少相比结构化不足方案的无效或违规执行;能使A3成本保持在工具代理方法水平或更低;并通过A4的澄清和结构化状态提升歧义性与多轮一致性。以下分析保留混合与负面发现,而非在观察结果后重新定义这些假设。  

## 4 SemPlan基准测试  

### 4.1 合成企业领域  

基准测试使用合成的*Northstar Commerce*分析领域。其关系数据涵盖客户、产品、订单、支付、费用、预算、供应商、合同及日历维度。货币价值、日期、状态字段及派生业务指标由确定性种子生成,并记录了相关不变量。参考执行环境使用受管控的PostgreSQL视图与只读执行策略。  

### 4.2 案例生成、审查与划分  

基准构建将文本案例与底层表格数据分离。参数化语义模板定义意图、指标、维度、过滤器、时间上下文、分组、排序、限制、模糊条件和策略预期。表面形式为英语和巴西葡萄牙语生成,然后通过规范标识符与语言质量验证。黄金语义计划对参考数据库确定性执行以产生标准化黄金答案。在测试划分冻结前,案例通过结构与词汇血统去重。  

发布的基准规模包含1,800个案例:900个英语(en-US)和900个巴西葡萄牙语(pt-BR)。其划分为开发集(300)、验证集(300)、公开测试集(500)、隐藏测试集(300)、多轮对话集(200)及对抗集(200)。固定的科学评估子集包含1,200个案例:公开测试集、隐藏测试集、多轮对话集及对抗集。开发集和验证集被排除在主要科学比较之外。发布清单记录了3,600条由单一人审阅者批准的案例/黄金审查记录。这种强人工参与角色被视为有效性局限,而非隐藏信息。  

**表1:SemPlan基准测试1.0.0-rc.2固定版本组成**  
该基准包含查询、分组聚合、排名、比较、差异、趋势、份额/比率、过滤、合同状态、模糊、超范围、多轮对话及对抗案例。难度标签源于记录在案的结构因素,而非模型性能。  

### 4.3 双语案例示例  

典型的单轮案例要求根据明确业务过滤获取受管控指标。例如,英语表述可能为*“2022年1月,北部地区通过在线渠道的消费类客户净收入是多少?”*;其巴西葡萄牙语对应表达相同语义为*“Qual foi a receita líquida dos clientes do segmento consumidor na região Norte pelo canal online em janeiro de 2022?”*。规范语义请求识别net_revenue、区域/渠道/细分过滤及时间窗口。此示例阐释了基准契约;主要评估使用固定的案例工件,而非文中手动改写的示例。  

## 5 评估方法  

四种方法均使用相同配置的模型gpt-5.6-luna,通过提供商中立的OpenAI适配器,推理强度设为low,输出上限为1,200个token。提示词按方法独立冻结。图1总结了模型与确定性职责的分配。  

```
A1: 用户查询 → LLM → SQL → SQL守卫 → DB  
A2: 用户查询 → LLM代理 → 类型化工具 → 确定性执行器 → DB  
A3: 用户查询 → LLM → 语义请求 → 归一化+执行 → DB  
A4: 查询+结构化状态 → LLM → 请求/澄清/修补 → 归一化+状态+执行 → DB  
```  

**图1:SemPlan对比中结构介入的位置**  
仅A1允许模型生成SQL。A2将模型操作约束为类型化工具。A3和A4发出类型化语义请求,由确定性软件归一化并执行;A4额外暴露结构化状态与澄清行为。  

- **A1:直接SQL**  
模型接收表述、区域设置、参考日期、紧凑的受控视图模式及相关指标定义。返回包含SQL或类型化拒绝的严格JSON。生成的SQL不直接执行:必须通过解析、AST白名单、复杂度限制、只读授权、语句超时和行数限制。A1从不接收黄金SQL、计划或答案。  

- **A2:工具代理**  
模型接收一组有限的分析工具,用于聚合、排名、周期比较、预算比较、合同状态和字段描述等操作。工具参数遵循严格模式与规范目录标识符。代理只能组合有限数量的工具调用,不能执行任意SQL或发明工具。确定性执行器实现底层分析操作。  

- **A3:语义请求**  
模型不生成SQL。而是发出包含操作、指标、维度、过滤器、时间粒度、排序、限制、比较字段、澄清字段和置信度的严格语义请求信封。确定性归一化验证标识符与类型,解析记录在案的语义规则,并将请求编译为可执行语义计划。受管控的软件随后生成参数化SQL或等效确定性操作符调用。因此SQL存在于A3中,但由应用程序而非LLM生成。  

- **A4:澄清与结构化状态**  
A4扩展了A3接口,增加先前结构化状态、类型化澄清结果及多轮对话请求的显式PATCH/REPLACE语义。仅由PATCH显式更改的字段在兼容性规则下更新;超范围的对话轮次保留状态,除非重置。执行在归一化后保持确定性。  

## 6 实验设置  

冻结实验使用基准测试版本1.0.0-rc.2,所有主要对比均采用相同的案例集、数据库快照、模型配置及方法特定的固定提示。1,200个科学案例在每个方法(A1–A4)下各执行一次,产生4,800条主记录。随后,对150个案例的确定性分层子集每种方法再执行两次,产生1,200条稳定性记录。这些重复仅分析方法内可重复性,不增加主样本量。因此,完整的科学运行包含6,000个计划的请求标识。  

主要二元终点在案例对齐记录上进行比较。对二元结果使用McNemar检验和配对风险差(95%置信区间),并对预设的主要比较族应用Holm-Bonferroni调整。偏态连续结果(如API成本)使用配对自举对比。在统计解释前区分提供商、传输、基础设施及模型质量故障。当系统提供足够证据进行分类时,模型质量故障仍作为科学结果的一部分。  

延迟虽已预设,但被排除在主要结论之外。事后审计发现,捕获的类型化故障记录延迟为零,且这些故障在方法间分布不均。因此,所得中位数不具可比性。

相似文章

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。

SIMMER: 使用世界模型对LLM可执行规划中的潜在故障进行基准测试

arXiv cs.CL

介绍了Simmer,这是一个基准测试,用于评估LLM生成的可执行计划中的潜在故障,使用了在厨房领域人工策划的符号世界模型。实验表明,前沿LLM最多只能生成17%的无错误计划,高达56%的计划包含潜在故障,而反事实前瞻模拟能显著减少故障。