PARSER:面向长上下文LLM代理的并行读取与深度推理

Hugging Face Daily Papers 论文

摘要

PARSER引入了一种解耦架构,使用scatter-gather子代理进行并行块读取和迭代推理,显著提高了长上下文多跳准确性,并减少了LLM代理的延迟。

顺序记忆代理通过一个接一个地读取块并保持紧凑的记忆状态来处理长文档,将文档遍历与推理深度耦合。这种耦合引入了对证据位置的敏感性,并将推理延迟与文档长度线性相关。我们引入了PARSER,它解耦了读取与推理。一组轻量子代理每个绑定到单个块,并行读取整个文档,而一个主导代理通过迭代scatter-gather轮次进行深度推理:在每一轮中,它向所有子代理广播一个查询,聚合返回的证据,并基于目前已发现的内容制定更深入的后续查询。这种解耦设计将所有可学习行为集中在主导代理中,主导代理通过强化学习进行优化,而子代理则保持为冻结的现成模型。在上下文范围从7K到896K令牌的多跳问答中,使用4B骨干的PARSER平均优于最强的顺序记忆基线5.7点,在896K令牌时优于12.0点。扩展到9B骨干时,PARSER超越DeepSeek-V4-Pro 6.3点。受控实验确认PARSER对证据位置、顺序和距离的扰动具有鲁棒性,这些条件在顺序方法中会导致准确性大幅波动,同时将推理延迟减少高达11倍。
查看原文
查看缓存全文

缓存时间: 2026/09/10 18:12

论文页面 - PARSER:并行阅读,深度推理——面向长上下文LLM智能体

来源:https://huggingface.co/papers/2609.06702
发布于9月6日

·

提交者:https://huggingface.co/inNexus

Kun LI (https://huggingface.co/inNexus) 于9月10日

摘要

PARSER通过分散-聚集子智能体将并行分块阅读与迭代推理解耦,提升了长上下文多跳推理的准确性并降低了延迟。

序列记忆智能体(https://huggingface.co/papers?q=Sequential%20memory%20agents)通过逐个顺序读取文本块并维护紧凑的记忆状态来处理长文档,将文档遍历与推理深度耦合。这种耦合导致对证据位置敏感,并使推理延迟随文档长度线性增长。我们引入PARSER(https://huggingface.co/papers?q=PARSER),将阅读与推理解耦。一组轻量级子智能体(https://huggingface.co/papers?q=subagents)各自绑定单个文本块,并行阅读整个文档;而主导智能体通过迭代的分散-聚集轮次进行深度推理:每轮它向所有子智能体广播查询,聚合返回的证据,并基于当前发现制定更深入的后续查询。这种解耦设计将所有可学习行为集中在主导智能体中,并通过强化学习(https://huggingface.co/papers?q=reinforcement%20learning)进行优化,而子智能体则保持为冻结的现成模型。在上下文长度从7K到896K token的多跳问答(https://huggingface.co/papers?q=multi-hop%20QA)任务中,使用4B骨干模型的PARSER(https://huggingface.co/papers?q=PARSER)平均比最强的序列记忆基线高出5.7分,在896K token时高出12.0分。扩展到9B骨干模型后,PARSER(https://huggingface.co/papers?q=PARSER)比DeepSeek-V4-Pro(https://huggingface.co/papers?q=DeepSeek-V4-Pro)高出6.3分。受控实验证实PARSER(https://huggingface.co/papers?q=PARSER)对证据位置、顺序和距离的扰动具有鲁棒性——这些条件会导致序列方法产生大幅精度波动——同时将推理延迟降低最高达11倍。

查看arXiv页面 (https://arxiv.org/abs/2609.06702) 查看PDF (https://arxiv.org/pdf/2609.06702) 项目页面 (https://cuhk-parser.github.io/) GitHub2 (https://github.com/cuhk-parser/PARSER) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.06702)

在您的智能体中获取此论文:

hf papers read 2609.06702

没有最新CLI?运行以下命令安装:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型:0

无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.06702 以从本页链接。

引用此论文的数据集:0

无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.06702 以从本页链接。

引用此论文的Spaces:0

无Space链接此论文

在Space README.md中引用 arxiv.org/abs/2609.06702 以从本页链接。

包含此论文的收藏集:0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

长时段LLM智能体服务的并行上下文压缩

arXiv cs.AI

介绍了用于长时间范围LLM智能体的并行上下文压缩,实现了对摘要量的细粒度控制,并相比多个骨干模型上的顺序同步压缩,降低了端到端延迟。