多智能体推理中的流式通信
摘要
StreamMA 提出了一种用于多智能体推理的流式通信范式,通过管道化中间结果来降低延迟,并利用更可靠的早期步骤提升效果,在多个基准测试中优于基线方法,同时揭示了步骤级别的缩放定律。
查看缓存全文
缓存时间: 2026/06/04 03:41
Paper page - 多智能体推理中的流式通信
来源:https://huggingface.co/papers/2606.05158
摘要
StreamMA 通过流式传输中间结果并利用可靠的早期步骤,实现了高效的多智能体推理,在多种推理任务中同时改善了延迟和有效性。
多智能体推理系统(https://huggingface.co/papers?q=Multi-agent%20reasoning%20systems)采用“先生成后传输“的范式,导致端到端延迟(https://huggingface.co/papers?q=end-to-end%20latency)与流水线深度呈线性增长。我们提出了 StreamMA,一种多智能体推理系统,它在每个推理步骤生成后立即将其流式传输到下游智能体,通过管线化(https://huggingface.co/papers?q=pipelining)相邻智能体来降低延迟。令人惊讶的是,这种管线化(https://huggingface.co/papers?q=pipelining)同时提升了有效性:由于多步推理的质量是不均匀的,早期步骤比后期步骤更可靠,使用这些可靠的早期步骤而非完整链条(https://huggingface.co/papers?q=chain)可以防止容易出错的后期步骤误导下游智能体。我们通过首次对流式、串行和单一协议(https://huggingface.co/papers?q=single%20protocol)进行闭式联合分析,形式化了这两个优势,推导出有效性排序(https://huggingface.co/papers?q=effectiveness%20ordering)、加速上限(https://huggingface.co/papers?q=speedup%20upper%20bound)和成本比(https://huggingface.co/papers?q=cost%20ratio)。在跨越数学、科学和代码的八个推理基准(https://huggingface.co/papers?q=reasoning%20benchmarks)上,使用两个前沿大语言模型(https://huggingface.co/papers?q=LLMs)(Claude Opus 4.6 和 GPT-5.4)以及三种拓扑(Chain(https://huggingface.co/papers?q=Chain)、Tree(https://huggingface.co/papers?q=Tree)、Graph(https://huggingface.co/papers?q=Graph)),StreamMA 在两个基线上均表现更优(在 HMMT 2026 上平均 +7.3 个百分点,最高 +22.4 个百分点;Claude Opus 4.6-high)。除了这些贡献,我们还发现了一个“步骤级缩放定律(https://huggingface.co/papers?q=step-level%20scaling%20law)“:增加每个智能体的步骤能够持续提升有效性和效率,这是一个与智能体数量缩放(https://huggingface.co/papers?q=agent-count%20scaling)正交且可组合的新缩放维度。
查看 arXiv 页面(https://arxiv.org/abs/2606.05158)查看 PDF(https://arxiv.org/pdf/2606.05158)项目页面(https://zhenyangcs.github.io/StreamMA-website/)GitHub2(https://github.com/EnVision-Research/StreamMA)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05158)
引用此论文的模型0
没有模型链接此论文
要在模型 README.md 中引用 arxiv.org/abs/2606.05158,以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
要在数据集 README.md 中引用 arxiv.org/abs/2606.05158,以从本页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
要在 Space README.md 中引用 arxiv.org/abs/2606.05158,以从本页面链接。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集(https://huggingface.co/new-collection)以从本页面链接。
相似文章
@XuXander24218:StreamMA:让多智能体系统更快更准确!大家好!我们的团队刚刚发布了StreamMA。它是一个…
StreamMA是一种多智能体推理系统,它逐步流式传输中间结果以改善延迟和准确性,在基准测试中实现了高达26.9倍的加速和+7.3%的性能提升。
StreamMemBench:面向未来辅助的代理记忆流式评估
StreamMemBench是一个新的流式基准测试,用于评估个人代理记忆系统如何利用观察到的证据和用户反馈来实现面向未来的辅助。实验表明,当前系统通常无法将存储的信息转化为可靠的后续行为。
AgentStream:自进化LLM智能体在流式任务下表现如何?
AgentStream引入了一个统一框架,用于在流式任务场景下评估自进化LLM智能体,结果表明自进化的可靠性在不同场景下有所差异,并受模型能力制约。
多流大语言模型:通过并行思维、输入与输出流解锁语言模型的潜力
本文提出了多流大语言模型(Multi-Stream LLMs),将基于顺序消息的指令微调转变为并行流处理。这种方法允许语言模型在多个并发数据流中同时进行读取、思考和生成,解决了自主智能体应用中的瓶颈问题。
递归多智能体系统
本文提出RecursiveMAS,一种将递归扩展原则应用于多智能体系统的框架,以提升协作推理的效率和准确性。与标准基线相比,该框架在多个基准测试中实现了显著的加速和token缩减。