PARSER:面向长上下文LLM代理的并行读取与深度推理
摘要
PARSER引入了一种解耦架构,使用scatter-gather子代理进行并行块读取和迭代推理,显著提高了长上下文多跳准确性,并减少了LLM代理的延迟。
查看缓存全文
缓存时间: 2026/09/10 18:12
论文页面 - PARSER:并行阅读,深度推理——面向长上下文LLM智能体
来源:https://huggingface.co/papers/2609.06702
发布于9月6日
·
提交者:https://huggingface.co/inNexus
Kun LI (https://huggingface.co/inNexus) 于9月10日
摘要
PARSER通过分散-聚集子智能体将并行分块阅读与迭代推理解耦,提升了长上下文多跳推理的准确性并降低了延迟。
序列记忆智能体(https://huggingface.co/papers?q=Sequential%20memory%20agents)通过逐个顺序读取文本块并维护紧凑的记忆状态来处理长文档,将文档遍历与推理深度耦合。这种耦合导致对证据位置敏感,并使推理延迟随文档长度线性增长。我们引入PARSER(https://huggingface.co/papers?q=PARSER),将阅读与推理解耦。一组轻量级子智能体(https://huggingface.co/papers?q=subagents)各自绑定单个文本块,并行阅读整个文档;而主导智能体通过迭代的分散-聚集轮次进行深度推理:每轮它向所有子智能体广播查询,聚合返回的证据,并基于当前发现制定更深入的后续查询。这种解耦设计将所有可学习行为集中在主导智能体中,并通过强化学习(https://huggingface.co/papers?q=reinforcement%20learning)进行优化,而子智能体则保持为冻结的现成模型。在上下文长度从7K到896K token的多跳问答(https://huggingface.co/papers?q=multi-hop%20QA)任务中,使用4B骨干模型的PARSER(https://huggingface.co/papers?q=PARSER)平均比最强的序列记忆基线高出5.7分,在896K token时高出12.0分。扩展到9B骨干模型后,PARSER(https://huggingface.co/papers?q=PARSER)比DeepSeek-V4-Pro(https://huggingface.co/papers?q=DeepSeek-V4-Pro)高出6.3分。受控实验证实PARSER(https://huggingface.co/papers?q=PARSER)对证据位置、顺序和距离的扰动具有鲁棒性——这些条件会导致序列方法产生大幅精度波动——同时将推理延迟降低最高达11倍。
查看arXiv页面 (https://arxiv.org/abs/2609.06702) 查看PDF (https://arxiv.org/pdf/2609.06702) 项目页面 (https://cuhk-parser.github.io/) GitHub2 (https://github.com/cuhk-parser/PARSER) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.06702)
在您的智能体中获取此论文:
hf papers read 2609.06702
没有最新CLI?运行以下命令安装:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型:0
无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.06702 以从本页链接。
引用此论文的数据集:0
无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.06702 以从本页链接。
引用此论文的Spaces:0
无Space链接此论文
在Space README.md中引用 arxiv.org/abs/2609.06702 以从本页链接。
包含此论文的收藏集:0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
Second Thought:在LLM代理行动与观察时的并行推理
Second Thought是一个无需训练的框架,它在LLM代理行动-观察等待期间并行运行辅助推理分支,以减少序列解码和轮次计数,同时不损害准确性。
长时段LLM智能体服务的并行上下文压缩
介绍了用于长时间范围LLM智能体的并行上下文压缩,实现了对摘要量的细粒度控制,并相比多个骨干模型上的顺序同步压缩,降低了端到端延迟。
LLM能否深入理解计算机架构论文的技术内容
本文提出了Gauntlet,一个使用LLM的多智能体流水线,用于对计算机架构论文进行深度技术理解,并表明在20次比较中,其分析结果有15次优于人工分析。
并行LLM推理实现抗偏差、稳健的概念抽象
本文提出了一种并行分块处理长文档的框架,利用LLMs减少累积偏差并提高证据可追溯性,显著降低了遗漏错误和无依据主张。
PARALLEL:一种受前额叶对齐强化启发的语言模型学习范式,在显式约束下进行自适应
本文介绍了PARALLEL,一种受前额叶对齐强化启发、用于语言模型学习的方法。该方法决定对每个样本进行适配的时机和强度,使用独立的控制器信号来提高适配效率,同时保持高性能。