通过自适应结构化非结构化数据的令牌高效数据推理代理

Hugging Face Daily Papers 论文

摘要

本文提出智能数据解析方法,该方法在LLM推理过程中自适应地结构化非结构化数据,以减少令牌消耗和成本,在保持基准测试准确性的同时实现显著的成本削减。

有价值的数据仍然嵌入在非结构化来源中:网页、报告、合同、备案、财报电话会议以及PDF文件。企业AI的宏大愿景是部署LLM代理,通过推理这些数据来为每位知识工作者解答复杂问题。目前代理可以做到这一点,但成本高昂。每个问题都会反复打开大型文档以回收分散的证据,消耗多达一百万个令牌。然而,如果数据已经结构化,同样的问题将简化为廉价的数据库查询。例如,在FanOutQA基准测试中,对理想预结构化存储进行推理的成本低28倍,随着问题在更多文档中展开,差距会扩大到数量级。然而,提前对所有内容进行结构化是不可行的:文档包含的可能结构远超任何工作负载的使用量,而有用的结构和文档在查询到达之前是未知的。我们提出智能数据解析,一种在推理过程中作为副产品自适应和推测性地结构化非结构化数据的方法。结构化是自适应的,因为观察到的查询决定何时发生以及什么重要;它是推测性的,因为它超越了当前问题。每当代理打开文档回答时,一个解析子代理从已加载的上下文中分叉,以微小成本提取可能服务于相关未来查询的基于事实的结构。随着时间的推移,越来越多的查询被结构化数据完全覆盖,并在不打开文档的情况下得到回答,使代理准确性接近RAG成本。在FanOutQA测试中,每个测试问题仅扩展一个相关问题,解析在保持准确性的同时将成本降低了53%。智能数据解析是迈向非结构化数据智能推理的下一代数据基础设施的第一步:在模型下方的共享基础层,其中推理已支付成本发现的知识得以积累。
查看原文
查看缓存全文

缓存时间: 2026/09/02 19:47

论文页面 - 通过自适应结构化非结构数据实现Token高效的数据推理代理

来源:https://huggingface.co/papers/2608.31082

摘要

宝贵的数据仍然嵌入在非结构化来源中:网页、报告、合同、备案文件、财报电话会议和PDF。企业人工智能领域的重大押注是部署大型语言模型代理来处理这些数据,以回答每个知识工作者的复杂问题。代理今天就可以做到这一点,但成本高得令人望而却步。每个问题会反复打开大型文档来检索分散的证据,消耗多达一百万个Token。然而,如果数据已经结构化,同一个问题就会简化为一个廉价的数据库查询。例如,在FanOutQA基准测试中,处理一个理想的预结构化存储的成本要低28倍,并且随着问题在更多文档中展开,成本差距会扩大到数量级。然而,提前将所有内容结构化并不可行:文档包含的潜在结构远超任何工作负载会使用的量,而且有用的结构和文档在查询到达之前都是未知的。我们提出了代理数据解析,一种方法,该方法将非结构化数据作为推理本身的副产品,自适应且推测性地进行结构化。结构化是自适应的,因为观察到的查询决定了何时发生以及什么重要;它是推测性的,因为它超越了当前问题。每当代理打开一个文档进行回答时,一个解析子代理会以极小的成本从已加载的上下文中分叉出来,并提取可能服务于相关未来查询的基础结构。随着时间的推移,查询中完全由结构化数据覆盖并无需打开文档即可回答的比例越来越高,使代理的准确性保持在接近检索增强生成的成本水平。在FanOutQA上,仅扩展每个测试问题一个相关问题,解析就降低了53%的成本,同时保持了准确性。代理数据解析是迈向非结构化数据下一代数据基础设施的第一步:这是模型下方的一个共享基质,推理已经付费去发现的知识在此积累。

查看arXiv页面 (https://arxiv.org/abs/2608.31082) 查看PDF (https://arxiv.org/pdf/2608.31082) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31082)

在您的代理中获取本文:

hf papers read 2608\.31082

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文

在模型README.md中引用 arxiv.org/abs/2608.31082 以从此页面链接。

引用本文的数据集 0

没有数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2608.31082 以从此页面链接。

引用本文的空间 0

没有空间链接本文

在空间README.md中引用 arxiv.org/abs/2608.31082 以从此页面链接。

包含本文的收藏 0

没有包含本文的收藏

将本文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

自适应潜在智能体推理

arXiv cs.CL

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。

智能体图令牌推理

arXiv cs.LG

提出了一种智能体图令牌推理方法,将图令牌化重新构建为LLM逐步推理过程的一部分,使模型能够在推理过程中动态选择图视图和粒度。该方法在七个图领域上优于基线,并能零样本迁移到未见领域。