@rohanpaul_ai: 斯坦福新论文指出,在同等推理预算下,单个LLM通常比多个……更好地解决多跳问题
摘要
一项新的斯坦福论文显示,在同等推理token预算下,单个LLM在多跳推理任务上通常优于多智能体系统,而多智能体设置带来的提升往往来自更多计算而非架构优势。该论文利用数据处理不等式解释为什么交接中的信息丢失会损害多智能体性能,并指出上下文质量是多智能体系统能够提供益处的关键因素。
查看缓存全文
缓存时间: 2026/05/19 16:47
斯坦福大学新论文指出,在相等的推理预算下,单个大语言模型解决多跳推理问题的效果通常优于多个协调模型。
核心观点几乎简单得令人尴尬。
单个智能体将整个问题保留在一个内部思维链中,而多智能体系统则必须将该链切分成消息、摘要和交接。
每一次交接都是一次压缩步骤。
而一旦推理过程被压缩,某些信息就比恢复更容易丢失——这就是为什么这篇论文以数据处理不等式作为形式化解释,而非仅仅依赖经验直觉。
实验在Qwen、DeepSeek和Gemini模型上,基于FRAMES和MuSiQue数据集验证了这一结论:当推理令牌预算相同时,单智能体系统通常能匹配或超越顺序式、辩论式、角色式及集成式多智能体架构。
这是大多数人忽略的部分。
许多被赞誉的多智能体优势可能根本不是架构优势。它们往往源于花费更多的测试时计算量、展现更多可见推理过程,或利用评估中的漏洞让流水线显得更智能。
论文在处理边界情况时尤为犀利,而非试图假装该规则放之四海而皆准。
当单智能体的有效上下文因遮蔽、替换或误导性干扰而退化时,多智能体流水线会变得更具竞争力,有时甚至胜出——并非因为消息传递具有魔力,而是因为结构化能在一定程度上稳定受损的推理。
这比“更多智能体更好“的论断要狭窄且有用得多。
它表明真正的权衡不在于单智能体与多智能体,而在于潜在推理与外部协调,具体哪一方表现更优取决于上下文质量和计算资源。
对于多跳推理,默认选择现在应明确:从一个强模型开始,将额外智能体视为修复策略,而非升级方案。
论文链接 – arxiv.org/abs/2604.02460
论文标题:“Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets”
相似文章
多智能体RL何时能提升LLM工作流?工作流、规模与策略共享的权衡
本文研究了端到端强化学习训练何时能改善多智能体LLM工作流,比较了不同工作流、任务和模型规模下的共享策略与隔离策略训练,揭示了条件性权衡。
法律中多智能体协商研究
本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。
当大型语言模型发展语言:用于高效多智能体推理的符号通信
本文提出通信语言符号路由(CLSR),多个LLM智能体自主发明并演化紧凑的符号语言进行推理,相比思维链(CoT)实现3-6倍的令牌减少,同时保持准确性。
@rao2z: \"当LLM输出逐步计划时,它会产生一种强烈的错觉,让你以为正在观看机器推理...
亚利桑那州立大学的Subbarao Kambhampati教授及研究人员在一篇立场论文中提出,LLM中的思维链推理制造了一种推理假象,业界需要超越昂贵的token生成,转向替代推理机制。
上下文、推理与层次结构:对抗性POMDP中复合LLM智能体设计的成本-性能研究
在对抗性POMDP(CybORG CAGE-2)中对复合LLM智能体设计进行了一项受控研究,系统性地在五个模型系列中变化上下文、推理与层次结构。主要发现:程序化状态抽象每token产生巨大回报,无推理工具的层次结构实现了最佳绝对性能,并且上下文工程比深度推理更具成本效益。