GROUND:通过受控语义定义减少基于LLM的企业分析中的幻觉
摘要
本文介绍了GROUND,这是一个受控语义检索框架,它将LLM生成的分析限制在已批准的业务定义内,有效减少企业数据分析中的幻觉,同时确保遵守安全和数据政策。
arXiv:2608.26157v1 Announce Type: new
摘要:对企业数据仓库进行自然语言分析越来越重要,但生产使用受到幻觉指标、无效连接、错误粒度、不安全数据访问和不受支持的解释的限制。现有的文本转SQL系统通常将生成基于数据库模式或检索到的文档,而企业报告还需要受控的业务语义:批准的指标、维度、连接路径、过滤器和行级安全性。本文介绍了GROUND,即统一标准化定义的受控检索,这是一个将LLM生成的分析限制在受控语义层的框架。GROUND提供已批准的定义,将用户意图绑定到受控指标和维度,并在执行前根据模式、指标、连接、粒度、过滤器、安全和成本规则验证生成的SQL。在违规时,它会重试或放弃。
在100个问题的合成企业报告基准测试中,GROUND与直接仅模式文本转SQL、模式RAG和仅语义基础在一个共享模型下进行比较。GROUND是唯一在六个评估类别中没有测量幻觉的系统,而未受控的系统在许多问题上违反行级安全性。仅语义条件具有精确的指标定义但没有访问策略,仍然会泄露数据,表明治理不能仅由指标保真度取代。研究结果在真实的美国NHTSA车辆安全数据上得到复现,使用独立手工编写的黄金标准,并在来自三个提供商的四个模型上测试了对抗集。GROUND的强制保证,特别是过滤器和行级安全性,在每个模型上都保持零违规,而依赖判断的行为,如拒绝未定义指标,仍然容易出错。
查看缓存全文
缓存时间: 2026/08/28 09:29
# GROUND:通过治理化语义定义减少基于大语言模型的企业分析中的幻觉 来源:https://arxiv.org/html/2608.26157 Aravind Sasidharan Pillai∗1 ∗1首席架构师,数据工程,Cox汽车公司,美国加利福尼亚州福斯特城 \(2026年7月\) ###### 摘要 对企业数据仓库进行自然语言分析是大语言模型一个日益重要的应用场景,但其生产应用受限于幻觉指标、无效连接、错误粒度、不安全数据访问以及未经验证的解释。现有的文本转SQL方法主要基于数据库模式或检索到的文档进行生成,而企业报告需要基于治理化的业务语义进行落地:即批准的指标、维度、连接路径、过滤器和行级安全。本文介绍了**GROUND**(基于统一规范化定义的治理化检索),它将大语言模型生成的分析约束在治理化的语义层中——提供已批准的定义,将意图绑定到在粒度和连接约束下批准的指标和维度上,并在执行前对每个查询进行模式、指标、连接、粒度、过滤器、安全和成本规则的验证,对违规情况进行重试,并在请求无法回答时予以弃权。在主要的合成实验中,与共享同一底层模型的三个基准——直接仅模式文本转SQL、模式RAG和仅语义落地——进行了比较,差异隔离了治理上下文的影响。GROUND是唯一在所有六个评估类别中均未出现可测量幻觉的系统,而每个非治理系统在许多问题上都违反了行级安全;关键在于,一个仅语义条件(具有精确的指标定义但没有访问策略)仍然会在租户边界间泄露数据,从而隔离出治理——而非指标保真度——是作为上下文的落地未能提供的属性。这大约消耗了直接基线5倍的令牌和1.3倍的延迟。我们在真实的美国国家公路交通安全管理局车辆安全数据上,使用独立手工编写的黄金标准验证了这些发现,并通过来自三个提供商(包括一个开源模型)的四个模型上的对抗集来探测GROUND的边界。GROUND的*强制*保证(过滤器、行级安全)在每个模型上都以零违规得到遵守——这种好处并非特定于模型——而依赖判断的行为(拒绝未定义的指标、选择澄清)即使在最强大的模型上也仍然容易出错。治理可以防止即使在较弱模型上出现安全关键的过滤器和行级安全违规,尽管结果准确性仍然与原始模型能力挂钩。 关键词:文本转SQL、企业分析、语义层、幻觉减少、商业智能、检索增强生成、数据治理、大语言模型 ## 核心贡献 GROUND是一个治理化的语义检索和验证框架,它将大语言模型生成的分析约束在批准的企业定义内,从而减少模式、指标、连接、粒度、过滤器、安全性和解释方面的幻觉。我们贡献了该框架、一个包含100个治理化报告问题的开放基准(配有确定性的、语义层驱动的黄金SQL生成器),以及一个受控的四路比较,表明在我们的基准测试中,仅凭语义定义无法实现行级安全合规——它需要由验证强制执行的显式访问策略。 ## 1引言 大语言模型越来越多地被嵌入商业智能工作流中,以便用户可以对企业数据仓库提出自然语言问题。然而,企业报告并非简单的模式转SQL问题。正确的答案依赖于治理化的业务语义:批准的指标、报告粒度、认可的连接路径、必需的过滤器、行级安全以及组织定义。 本文认为,企业分析中的幻觉应被视为*治理和语义*故障,而不仅仅是模型生成故障。一个模型可以生成语法有效、可执行的SQL,但仍然使用错误的指标、因粒度不匹配而重复计算、省略必需的过滤器,或者忽略行级安全。这样的答案比执行错误*更糟*:它看起来权威但实则无声地错误,在安全情况下则构成合规性违规。 ### 1.1动机 - •自然语言分析承诺更快的自助式报告,但不正确的答案会带来运营和合规风险。 - •原始的模式上下文不足,因为企业表暴露的是实现细节而非业务含义。 - •语义层提供批准的定义,可以在查询生成前约束大语言模型的行为。 - •一个专注于企业幻觉*类型*的基准比单纯评估执行准确性更能直接评估可靠性。 ### 1.2研究问题 ID | 研究问题 | 涉及章节 --- | --- | --- RQ1 | 语义层落地是否减少了对不存在的表和列的引用? | 第8节(模式) RQ2 | 治理化的指标检索是否减少了发明或错误的业务公式? | 第8节(指标) RQ3 | 连接路径和粒度验证是否减少了重复计算和扇出错误? | 第8节(连接、粒度) RQ4 | 行级安全检查能否防止未经授权的分析响应? | 第8节(安全)——核心发现 RQ5 | 语义验证和重试引入了哪些延迟和成本权衡? | 第8.2节(测量值) ### 1.3贡献 - •为企业分析制定幻觉分类法(第3节)。 - •GROUND,一个用于基于大语言模型分析的治理化语义层检索和验证框架,端到端实现(第4节)。 - •一个基于汽车零售报告模型构建的合成企业基准,包含100个问题,配有由语义层驱动的确定性黄金SQL生成器(第5节)。 - •在相同模型下,与直接文本转SQL、模式RAG和仅语义基准进行受控比较(第6节、第8节)。 - •评估指标包括结果正确性(严格和基于值)、治理合规性、粒度正确性和澄清准确性,并包含一个通过预言机自测试验证的自动化分类器套件(第7节)。 - •公开发布基准、语义层、黄金SQL和评估工具——配有预言机自测试和按领域复制的命令(附录C,github.com/aravindsp/ground-benchmark)。 ## 2相关工作 GROUND建立在文本转SQL基准测试、检索增强生成、企业模式落地、语义层和幻觉缓解等领域的研究基础上。其独特之处在于,它将企业分析幻觉视为治理化数据系统故障,而不仅仅是语言模型生成错误。 ### 2.1文本转SQL基准测试 文本转SQL传统上使用跨领域语义解析基准进行评估。Spider [1] 引入了一个大规模复杂跨领域基准,包含10,181个自然语言问题、5,693个SQL查询、200个数据库和138个领域,要求模型泛化到未见过的模式和SQL模式。BIRD [2] 扩展了这项工作,针对更大的真实世界数据库,强调数据库值、外部知识、脏数据内容以及SQL效率,包含12,751个文本转SQL对和95个数据库。这些基准对于衡量模式泛化和执行准确性仍然至关重要,但它们并未将企业治理约束——批准的指标、报告粒度、必需的过滤器和行级安全——作为首要评估维度。 最近的企业导向基准正在缩小这一差距。Spider 2.0 [3] 评估涉及复杂云和本地数据系统(包括BigQuery和Snowflake)的真实世界企业文本转SQL工作流,并报告了与Spider 1.0和BIRD相比的大幅性能下降。BEAVER [4] 从具有复杂模式和分析查询的真实私有数据仓库构建了企业文本转SQL基准,并发现那些在公共基准上表现出色的模型在这些环境中表现不佳。EntSQL [5] 进一步强调了企业特有的挑战,包括私有仓库模式、领域知识、业务文档、内部指标、报告惯例和组织规则。GROUND与这些基准互补:它不是衡量通用企业工作流的完成度,而是隔离治理化分析的故障模式,并将它们分别评分为模式、指标、连接、粒度、过滤器、安全、解释和成本幻觉。 ### 2.2检索增强生成与模式落地 检索增强生成 [6] 将参数化语言模型与检索到的外部上下文相结合,提高了知识密集型任务的事实性和可溯源性。在文本转SQL系统中,检索通常用于模式链接 [7]、表选择、列描述、文档片段和值落地。例如,RASL [8] 将庞大的企业模式和元数据分解为索引化的语义单元以进行针对性检索,解决了大型数据目录的上下文预算问题。 GROUND包含一个模式RAG基准,但认为仅靠检索不足以支持治理化分析。检索到的表或列描述可能有助于模型选择正确的物理对象,但仍然无法强制执行批准的指标公式、聚合粒度、必需的业务过滤器或特定用户的访问策略。从这个意义上说,GROUND将检索视为必要但不充分的:检索到的上下文必须与验证和策略执行相结合。 ### 2.3用于基于大语言模型分析的语义层 语义层和指标层定义了物理数据之上的业务导向抽象:批准的指标、维度、连接、粒度、过滤器和访问策略。最近的工作开始将语义层直接连接到自然语言分析。由语义层介导的NL2SQL代理 [9] 通过基于精选的语义模型或中间表示进行推理,然后将其编译成特定方言的SQL,从而将用户意图与物理SQL解耦。 与我们最接近的先前工作是 [10],它在100个问题上对三个前沿模型(Claude Opus 4.7、Sonnet 4.6和GPT-5.4)进行了基准测试,使用零售仓库数据,并采用配对的*仅模式*与*模式加语义*协议进行。它报告说,一个4KB的手工编写的语义文档将准确性提高了17-23分,有了该文档,这三个模型变得统计上无法区分,并且语义上下文的存在——而非模型选择——解释了几乎所有的差异;它将其框架化为一个*结构性*结果,即明确的业务语义通过改变模型被要求执行的任务(而非使其更具能力)来抑制主要的文本转SQL错误类别。GROUND共享这一前提,并沿三个轴进行扩展。 *上下文与执行*。[10] 将语义作为上下文提供;GROUND额外对其进行了*验证和执行*。其“模式加语义”条件恰好对应于我们的*仅语义*基准(第6节)——在提示中提供已批准的定义,没有验证循环,也没有注入的访问策略。我们的结果显示,单独的上下文留下了一个残余的治理缺口,而作为上下文的落地无法弥合:最突出的是行级安全,在指标保真度完美的情况下,仅语义条件在35-47%的问题上仍然违规。只有通过注入策略的验证和重试循环才能将其降至零。这区分了 [10] 视为一体的两件事——提供语义与*保证*语义。 *聚合幻觉与治理分类法*。[10] 评估聚合准确性和单一配对幻觉率。GROUND将故障分解为七种治理特定类型(模式、指标、连接、粒度、过滤器、安全、成本)并独立评分,特别将访问控制/行级安全作为首要维度——这是一个约束,[10] 和企业文本转SQL基准 [3, 4, 5] 完全没有建模,然而在我们的结果中它是决定性的区分因素。 *证据广度*。我们在合成数据和真实的NHTSA数据上进行评估,配有独立手工编写的黄金标准(打破了共享机制的批评),增加了暴露GROUND自身故障边界的对抗集,并跨越来自三个提供商的四个模型(包括一个开源模型),进行重复运行。这使我们能够将 [10] 的“模型选择不重要”精炼为更尖锐、可检验的论断:*强制*治理属性是确定性的且与模型无关(跨模型和运行结果为0.000±0.000),而依赖判断的属性(识别未定义的指标、选择澄清)仍然是概率性的且受能力限制。因此,GROUND不仅将语义层视为模型上下文,更将其视为SQL生成的可执行控制平面。 ### 2.4治理化企业分析系统 另一条相关的工作路线通过治理化分析API [11] 路由自然语言意图,避免无约束的文本转SQL。此类系统将业务逻辑、权限和可视化约束封装在企业API背后,而不是允许模型自由生成原始SQL。这与GROUND的动机密切相关:企业分析系统必须保持一致性、可审计性和安全性,不应将聚合逻辑或访问控制完全委托给大语言模型。 GROUND的不同之处在于,它保持在文本转SQL设置内,但在生成时注入和验证治理规则。这使得在相同模型和基准下,比较直接仅模式SQL生成、模式RAG、仅语义落地和完整的治理化落地成为可能。 ### 2.5幻觉与可信数据系统 一般幻觉研究 [12] 研究流畅但缺乏支持或事实不正确的模型输出。在企业分析中,幻觉通常表现为可执行的SQL返回一个看似合理但无效的业务答案。这种形式的幻觉尤其危险,因为SQL可能被解析、执行并产生一个看起来整洁的数字,同时却违反了指标定义、粒度、过滤器或安全约束。 因此,GROUND将幻觉分析应用于结构化分析。它不将幻觉视为通用的文本故障,而是定义了具体的企业分析幻觉类型——模式、指标、连接、粒度、过滤器、安全、解释和成本——并分别评估每个类别。这种分类法使得仅靠执行准确性可能遗漏的故障变得可见。 ## 3问题定义 设用户问题 *q*,由具有访问角色 *r(u)* 的用户 *u* 提出,通过生成的SQL查询 *s* 和可选的自然语言解释 *e* 在数据库 *D* 上回答。在企业分析中,正确性要求不止于执行:*s* 必须满足模式有效性、语义(指标)有效性、粒度有效性、连接有效性、过滤器合规性、对 *r(u)* 的安全合规性,以及对 *e* 的答案支持。一个可信的系统还必须认识到在治理下 *q* 何时*无法回答*并适当地弃权。 ### 3.1企业分析幻觉分类法 幻觉类型 | 定义 | 示例故障 --- | --- | --- 模式 | 引用不存在的表或列 | 当`dealer_profit_summary.net_revenue`两者都不存在时使用它 指标 | 发明或更改已批准的业务公式 | 使用无治理指标定义的客户生命周期价值 连接 | 使用无效或未批准的连接路径 | 直接将车辆连接到维修工单行 粒度 | 在错误的级别聚合或重复计算 | 将维修工单行计为维修工单 过滤器 | 省略必需的语义过滤器 | 在客户视图中包含保修/内部工作
相似文章
Grounded Optimization:一种用于减少自动个人文档重写中LLM幻觉的分层工程框架
本文提出了Grounded Optimization,一个五层框架,用于减少自动个人文档重写中的LLM幻觉。实验表明,在各种模型和温度设置下,幻觉率显著降低。
零幻觉,通过构造实现:面向可信企业AI的幻觉感知分层监督
提出HALO架构,该架构包含六层防御机制,以遏制企业AI系统中的幻觉现象,将'零幻觉'重新定义为系统强制属性而非模型属性。
LLMs中的幻觉:基于生命周期的成因、检测、缓解与预防综述
这篇综述论文提出了一种基于生命周期的框架,用于理解LLMs中的幻觉现象,涵盖数据、训练和推理阶段的成因、检测、缓解与预防。
为何LLM幻觉不是模型问题——而是系统架构问题(4个生产环境护栏)
本文认为,生产环境中的LLM幻觉通常是系统架构问题,而非模型问题,并概述了四个关键护栏:RAG接地、实时工具/函数调用、选择性人工监督,以及红队/对抗性测试。
从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。