神经符号学在数据工程中的应用:无需微调实现长上下文令牌缩减

arXiv cs.CL 论文

摘要

本文提出了一种针对LLMs的神经符号层,无需微调即可将逻辑推理准确率提高8.5%,并在长上下文任务中将令牌使用量减少超过50%。

arXiv:2609.00367v1 Announce Type: new 摘要:大型语言模型越来越多地被用于复杂的数据工程任务,例如从自然语言生成结构化查询(Text-to-SQL)和自动化复杂电子表格操作。然而,最大化它们的效用不仅需要更高的无微调准确率,还需要解决由Transformer架构固有的二次(O(n2))时间复杂度带来的计算瓶颈。本文提出了一种新型的即插即用神经符号层,旨在无缝集成到现有的LLM骨干网络中,以增强逻辑推理并缓解长上下文资源消耗。在推理方面,该层立即并显著提高了性能,在包括BIRD-CRITIC和LiveSQLBench在内的严格基准测试中实现了平均准确率提升85%,关键是无需任何任务特定的微调或RLHF即可实现这些改进。同时,我们重新利用此方法来解决长上下文推理的严重计算压力。通过利用符号处理来优先处理和压缩相关上下文信息,该层将有效令牌使用量减少超过50%,并将有效时间复杂度从O(n2)降低到某些长上下文任务中的近似O(n)。这种双重影响的方法不仅使LLMs在数据工程中更加可靠,还大幅降低了推理芯片的计算压力,使长上下文任务更易于管理和更具成本效益。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:50

# 用于数据工程的神经符号技术:在长上下文任务中实现超过50%的Token缩减且无需微调
来源:https://arxiv.org/html/2609.00367
###### 摘要

大型语言模型正越来越多地应用于复杂的数据工程任务,例如从自然语言生成结构化查询和自动化复杂的电子表格操作。然而,要充分发挥其效用,既需要提高不依赖微调的准确度,也需要解决Transformer架构固有的二次方时间复杂度所带来的计算瓶颈。本文提出了一种新颖的、即插即用的神经符号层,旨在无缝集成到现有的LLM主干网络中,增强逻辑推理能力并缓解长上下文带来的资源消耗。在推理方面,该层能立即显著提升性能,在包括BIRD-CRITIC和LiveSQLBench在内的严格基准测试中,平均准确度提升8.5%,关键是这些提升无需任何任务特定的微调或RLHF。

同时,我们将此方法重新用于解决长上下文推理带来的严重计算压力。通过利用符号处理来优先处理和压缩相关上下文信息,该层将有效Token使用量减少了超过50%,并将某些长上下文任务的有效时间复杂度从O(n²)降低到近似O(n)。这种双重影响的方法不仅使LLM在数据工程方面更可靠,还大幅降低了推理芯片的计算压力,使大上下文任务更易于管理且更具成本效益。

## I 引言

大型语言模型集成到数据生态系统中,从根本上改变了用户与结构化信息交互和处理的方式。LLM在弥合自然语言与结构化操作之间的鸿沟方面展现了巨大潜力,尤其是在Text-to-SQL生成和自动化复杂的电子表格功能方面。这些能力有望显著提升企业数据可访问性和商业智能,但其大规模部署受到两个关键限制的阻碍。

首先,尽管LLM在语言流畅性方面表现出色,但它们在复杂数据工程任务所需的逻辑和系统推理方面常常存在不足。当前最先进的模型在高度复合查询或细微模式关系上经常失败,导致在BIRD-Bench套件和SpreadsheetBench等专业且稳健的基准测试中输出不可靠。要实现可靠的性能通常需要昂贵且迭代的微调和强化学习,这并不总是可行的。其次,普遍存在的Transformer架构的计算开销构成了严重瓶颈。自注意力机制的二次方时间复杂度O(n²)对高容量推理芯片来说计算负担沉重,尤其是在模型被要求处理越来越长的上下文输入时。这种低效率推高了运营成本,并限制了基于LLM的数据管道的可扩展性。

为了应对准确性和效率的双重挑战,我们提出了一种新颖的、即插即用的神经符号增强层。该层旨在与模型无关,能够无缝集成到任何预训练的LLM中,无需架构修改或昂贵的重新训练。通过在模型的前向传播中显式注入符号推理能力,我们可以增强逻辑基础和上下文利用。

我们的结果表明,在两个方面都实现了重大飞跃。在逻辑推理基准测试中,神经符号层作为即时性能提升器,在BIRD-CRITIC和LiveSQLBench上平均准确度提升了8.5%,关键是无需任何微调。同时,通过采用符号引导的上下文压缩机制,该层显著优化了运行时效率。我们展示,我们的方法将有效Token使用量减少了超过50%,并在LongBench v2上将模型的实际时间复杂度从O(n²)有效降低到近似O(n),从而缓解了推理硬件的压力。

BIRD-CRITIC 和 LiveSQLBench 上的执行准确率(%)
o4-mini, Gemini-2.5-Pro, CoreThink
图1:Text-to-SQL基准测试上的执行准确率。CoreThink在BIRD-CRITIC和LiveSQLBench上均优于现有方法。
## II 相关工作

### II-A Text-to-SQL基准测试

BIRD-CRITIC和LiveSQLBench代表了Text-to-SQL评估的扩展和演进。BIRD-CRITIC引入了一个迭代SQL优化的框架,模型可以基于执行反馈来批评和修正其初始SQL生成,模拟开发者实际调试查询的方式。这通过允许模型从错误中学习,解决了一次性生成基准测试的一个关键局限。而LiveSQLBench则专注于时间鲁棒性,测试Text-to-SQL系统是否能处理关于持续更新的真实世界数据库的查询。它评估模型是否能为内容频繁变化的时间敏感问题(如体育统计数据或股票价格)生成正确的SQL。这些基准测试共同超越了静态准确度指标,评估了Text-to-SQL系统更动态、实际的方面,包括错误纠正、实时数据处理以及在多样化和不断演化的数据库环境中的稳健性能。

### II-B 长上下文基准测试

LongBench v2是一个先进的基准测试,旨在评估大型语言模型处理长上下文输入的能力,通过更具挑战性和多样化的任务扩展并改进了其前身。随着该领域向支持10万token或更多上下文窗口的模型发展,LongBench v2通过纳入需要真正长程推理而非简单检索的更难任务,解决了早期长上下文基准测试的局限性。它包括多个任务类别,如单文档问答、多文档问答、摘要、少样本学习、代码补全以及测试特定能力的合成任务(如在极长上下文中进行“大海捞针”检索)。该基准测试强调答案需要综合分散在整个上下文窗口中的信息的任务,防止模型通过走捷径策略或仅关注局部信息而取得成功。LongBench v2还纳入了更现实的文档长度和结构,包括技术论文、书籍和串联的对话历史,以反映现实世界的用例。

BFCL v3 长上下文版本将函数调用评估扩展到涉及大上下文窗口的场景。函数调用——即模型必须根据用户请求决定何时以及如何调用外部工具或API——当用于做出这些决策的相关信息分布在长文档或对话历史中时,会变得极具挑战性。BFCL v3 长上下文版本测试模型是否能准确识别要调用的函数、从数千个token的上下文中提取正确的参数,并在长时间交互中保持连贯的函数调用行为。该基准评估对于需要管理长对话、引用大量文档或使用大型代码库同时仍需进行精确函数调用的生产就绪AI助手至关重要。它解决了孤立的函数调用基准与AI代理实际操作的混乱、上下文丰富的环境之间的关键空白,确保模型能够同时保持长程理解力和精确的工具使用能力。

## III 我们的方法:通用符号推理框架

通用符号推理框架代表了一种范式,旨在完全在自然语言中执行稳定、领域可适应且计算高效的推理。通过在纯自然语言到自然语言的基础上操作,GSR避免了与将人类语言翻译为形式逻辑或高维向量相关的表示损失和脆弱性。该架构采用分层方法,系统地处理从输入到解释的推理,保留原始语言的完整上下文和细微差别。该理想化架构中的每一层在推理管道中都承担着明确的职责。

### III-A 原生语言解析与语义保留

框架从直接的自然语言输入开始,所有推理过程始终在自然语言中进行,无需中间形式主义。这一设计选择确保了推理过程开始时不会丢失任何语义信息。系统集成了复杂的歧义识别能力,利用语言本身固有的词义消歧和语言模式识别来解决潜在的歧义。

### III-B 语言内推理架构

GSR通过自然语言转换应用逻辑规则,这些转换基于语言成分的句法和语义关系来操作,而不是依赖于抽象符号。这种通过NL模式强制约束的方法保留了关键的上下文信息。与形式抽象不同,GSR保持了实用区分——例如“必须”和“应该”之间的区别——以及情态和特异性,直接在语言中实现,从而支持更细微的推理能力。

### III-C 执行与可解释性

推理过程的每一步都通过逐字的推理轨迹保持人类可解释性,用平实、可审查的语言展示确切的推理路径、中间结论和检测到的任何矛盾。框架通过直接的语言标注(如突出显示假设中的冲突)来揭示不一致之处,使整个过程透明且可调试。对可解释性的这种承诺确保了错误传播在每个阶段都可以被追踪和理解。

### III-D 避免表示翻译的陷阱

GSR的一个基本原则是避免将自然语言翻译成向量或形式逻辑所带来的损失。这种翻译会剥离关键的上下文,而NL-to-NL过程保留了所有原始信息,从而实现更高保真的推理。自然语言比固有的还原论的形式逻辑具有更全面的表达能力。将自然语言强行塞入预定义的、僵化的结构中,必然会丢弃人类表达的丰富上下文结构。GSR利用语言的表达能力作为其核心优势,确保全面的推理能力。

### III-E 计算优化层

尽管强调保留语言的丰富性,GSR还是包含了计算优化机制。实体标记和基于搜索的剪枝最大限度地减少了可能给推理轨迹带来噪声的无关推断。该架构是为实时性能而设计的,旨在支持具有高度稳定性且不依赖于GPU等大规模计算资源的长期推理,使其能够在各种环境中实际部署。

### III-F 迈向GSR的神经符号步骤

虽然上文描述的完全实现的GSR框架仍是最终目标,但本文讨论了其实施的一个具体而强大的步骤:一个受GSR原则直接启发设计的神经符号框架。这个混合系统作为一座实用的桥梁,通过使用符号支架来编排和组合小型、高效的大语言模型,近似于纯NL-to-NL的理想状态。

在这种架构中,符号框架提供结构化的、组合式的推理路径,而神经网络组件则处理每个步骤中解析和转换的细微、基于模式的任务。这种方法使我们能够在今天的实际系统中实现GSR的核心优势——如组合逻辑和可解释的推理轨迹。本文中呈现的所有结果和分析都基于这种神经符号实现,它验证了GSR的核心原则,并标志着朝着实现真正的、全面的语言内推理智能迈出了关键一步。

## IV 评估

我们在两个不同的领域评估GSR神经符号框架,以展示其多功能性、计算效率和推理能力。我们的实验涵盖结构化查询生成和长上下文处理任务,在多个基准测试上建立了新的最先进结果,同时保持可解释性和效率。

### IV-A 用于Text-to-SQL生成的GSR

参考图注图2:用于Text-to-SQL生成的GSR流程概述我们实现了GSR作为Text-to-SQL任务的即插即用推理层,并在两个具有挑战性的基准测试上评估其性能:BIRD-CRITIC和LiveSQLBench。BIRD-CRITIC测试包含不一致数据的复杂、真实世界数据库的迭代SQL优化能力,而LiveSQLBench则评估在不断更新的数据库上的时间鲁棒性。

#### IV-A1 结果

表I展示了我们的结果与现有最先进系统的比较。GSR在两个基准测试上都取得了最佳性能,展示了卓越的推理和纠错能力。

表I:Text-to-SQL基准测试上的执行准确率。GSR在BIRD-CRITIC和LiveSQLBench上均优于现有方法。
#### IV-A2 为何重要

在这些基准测试上的卓越性能展示了GSR处理将自然语言转换为可执行SQL查询所需的复杂、多步骤推理的能力。BIRD-CRITIC测试的迭代优化能力对于生产系统尤为重要,因为初始查询生成可能需要基于执行反馈进行调试。LiveSQLBench的结果验证了GSR对时间动态的鲁棒性及其对时间敏感数据上下文进行推理的能力。与黑盒神经网络方法不同,GSR的推理轨迹提供了查询构建过程的完全透明性,使开发人员能够理解、验证和调试查询生成过程。这种可解释性对于企业部署至关重要,因为在企业部署中,查询正确性和可审计性是重中之重。

### IV-B 用于长上下文处理的GSR

参考

相似文章

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

arXiv cs.AI

本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。