通过自适应结构化非结构化数据的令牌高效数据推理代理
摘要
本文提出智能数据解析方法,该方法在LLM推理过程中自适应地结构化非结构化数据,以减少令牌消耗和成本,在保持基准测试准确性的同时实现显著的成本削减。
查看缓存全文
缓存时间: 2026/09/02 19:47
论文页面 - 通过自适应结构化非结构数据实现Token高效的数据推理代理
来源:https://huggingface.co/papers/2608.31082
摘要
宝贵的数据仍然嵌入在非结构化来源中:网页、报告、合同、备案文件、财报电话会议和PDF。企业人工智能领域的重大押注是部署大型语言模型代理来处理这些数据,以回答每个知识工作者的复杂问题。代理今天就可以做到这一点,但成本高得令人望而却步。每个问题会反复打开大型文档来检索分散的证据,消耗多达一百万个Token。然而,如果数据已经结构化,同一个问题就会简化为一个廉价的数据库查询。例如,在FanOutQA基准测试中,处理一个理想的预结构化存储的成本要低28倍,并且随着问题在更多文档中展开,成本差距会扩大到数量级。然而,提前将所有内容结构化并不可行:文档包含的潜在结构远超任何工作负载会使用的量,而且有用的结构和文档在查询到达之前都是未知的。我们提出了代理数据解析,一种方法,该方法将非结构化数据作为推理本身的副产品,自适应且推测性地进行结构化。结构化是自适应的,因为观察到的查询决定了何时发生以及什么重要;它是推测性的,因为它超越了当前问题。每当代理打开一个文档进行回答时,一个解析子代理会以极小的成本从已加载的上下文中分叉出来,并提取可能服务于相关未来查询的基础结构。随着时间的推移,查询中完全由结构化数据覆盖并无需打开文档即可回答的比例越来越高,使代理的准确性保持在接近检索增强生成的成本水平。在FanOutQA上,仅扩展每个测试问题一个相关问题,解析就降低了53%的成本,同时保持了准确性。代理数据解析是迈向非结构化数据下一代数据基础设施的第一步:这是模型下方的一个共享基质,推理已经付费去发现的知识在此积累。
查看arXiv页面 (https://arxiv.org/abs/2608.31082) 查看PDF (https://arxiv.org/pdf/2608.31082) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31082)
在您的代理中获取本文:
hf papers read 2608\.31082
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接本文
在模型README.md中引用 arxiv.org/abs/2608.31082 以从此页面链接。
引用本文的数据集 0
没有数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2608.31082 以从此页面链接。
引用本文的空间 0
没有空间链接本文
在空间README.md中引用 arxiv.org/abs/2608.31082 以从此页面链接。
包含本文的收藏 0
没有包含本文的收藏
将本文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
自适应潜在智能体推理
本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。
推理税:不同任务类型与部署情境下大语言模型推理的令牌经济学
本文提出“令牌经济评分”来衡量大语言模型在各类任务中推理的成本效益,揭示任务结构决定效率,并建议根据情境选择性部署推理功能。
研究人员让AI智能体优化LLM推理,Token用量锐减70%
研究人员开发了AutoTTS框架,通过AI智能体自动设计控制策略来优化LLM推理,在保持高推理准确率的同时,将Token消耗降低约70%。
智能体图令牌推理
提出了一种智能体图令牌推理方法,将图令牌化重新构建为LLM逐步推理过程的一部分,使模型能够在推理过程中动态选择图视图和粒度。该方法在七个图领域上优于基线,并能零样本迁移到未见领域。
并非所有Token都同等重要:通过强化学习中的Token重要性实现高效LLM推理
本文提出了一个强化学习框架,通过建模Token重要性来选择性地对不重要的Token进行惩罚,同时保留关键推理步骤,采用重要性感知奖励和动态长度奖励来减少冗余,在不牺牲准确性的前提下提高效率。