@XuXander24218:StreamMA:让多智能体系统更快更准确!大家好!我们的团队刚刚发布了StreamMA。它是一个…
摘要
StreamMA是一种多智能体推理系统,它逐步流式传输中间结果以改善延迟和准确性,在基准测试中实现了高达26.9倍的加速和+7.3%的性能提升。
查看缓存全文
缓存时间: 2026/06/05 13:17
StreamMA:让多智能体系统更快更准!
大家好!我们的团队刚刚发布了StreamMA。这是一种让多智能体系统既更快又更准确的新方法。核心思想简单但强大:不再等待一个智能体完成它的完整响应,而是逐步发送信息。每一个推理步骤都立即传递给下一个智能体。
为什么这样做效果这么好? 上游智能体发送一个步骤,下游智能体立即开始工作。这使得一切变得更快。令人惊讶的是,推理质量也变得更好了。复杂的推理步骤并非全部质量相同。早期步骤通常可靠且清晰。后期步骤更可能包含错误。StreamMA让下游智能体从可靠的早期步骤开始工作。等到错误出现时,其他智能体已经构建了自己强有力的推理路径。这自然减少了错误的影响。
关键贡献: 1 流协议:我们将通信从完整响应转变为单个步骤。这同时提升了速度和性能。 2 三个封闭形式定理:我们展示了Stream在何时效果最佳、理论加速上限以及成本比率。 3 步骤级缩放定律:在相同智能体数量下,增加步骤数同时提升准确性和速度。它与传统的智能体数量缩放配合得很好。
强大的实验结果: • 性能:在8个数学、科学和代码基准测试上平均提升+7.3个百分点(Opus 4.6) • 加速:使用64个智能体和64个步骤,我们获得了26.9倍推理加速(理论上限为32.3倍,我们达到了83%)(HMMT26 GPT5.4)
想了解更多? 论文:https://huggingface.co/papers/2606.05158… 项目页面:https://zhenyangcs.github.io/StreamMA-website… GitHub:https://github.com/EnVision-Research/StreamMA…
如果您从事多智能体系统、分布式推理或长链推理方面的工作,我们非常期待听到您的想法!这种流式思路带来了新的可能性。 #StreamMA #多智能体 #AI #推理 #LLM
论文页面 - 多智能体推理中的流式通信
来源:https://huggingface.co/papers/2606.05158
摘要
StreamMA通过流式传输中间结果,并利用可靠的早期步骤来缩短延迟并提升效果,从而在各种推理任务中实现高效的多智能体推理。
多智能体推理系统(https://huggingface.co/papers?q=Multi-agent%20reasoning%20systems)采用“生成-传输”范式,导致端到端延迟(https://huggingface.co/papers?q=end-to-end%20latency)随流水线深度线性增长。我们引入了StreamMA,一个多智能体推理系统,它在生成每个推理步骤后立即流式传输给下游智能体,对相邻智能体进行流水线化(https://huggingface.co/papers?q=pipelining),从而减少延迟。令人惊讶的是,这种流水线化(https://huggingface.co/papers?q=pipelining)也提升了效果:因为多步推理质量是非均匀的,早期步骤比后期步骤更可靠,使用这些可靠的早期步骤而不是完整链(https://huggingface.co/papers?q=chain),可以防止可能出错的后期步骤误导下游智能体。我们通过第一个针对流协议、串行协议和单协议(https://huggingface.co/papers?q=single%20protocol)的封闭形式联合分析,形式化地展示了这两种优势,推导出效果排序(https://huggingface.co/papers?q=effectiveness%20ordering)、加速上限(https://huggingface.co/papers?q=speedup%20upper%20bound)和成本比率(https://huggingface.co/papers?q=cost%20ratio)。在涵盖数学、科学和代码的八个推理基准测试(https://huggingface.co/papers?q=reasoning%20benchmarks)中,使用两个前沿LLMs(https://huggingface.co/papers?q=LLMs)(Claude Opus 4.6 和 GPT-5.4)以及三种拓扑(链Chain(https://huggingface.co/papers?q=Chain)、树Tree(https://huggingface.co/papers?q=Tree)、图Graph(https://huggingface.co/papers?q=Graph)),StreamMA在两个基线上均表现更优(平均+7.3个百分点,在HMMT 2026上最高+22.4个百分点;Claude Opus 4.6-high)。除这些贡献外,我们还发现了一个“步骤级缩放定律(https://huggingface.co/papers?q=step-level%20scaling%20law)”:增加每个智能体的步骤数持续提升效果和效率,这是一个新的缩放维度,正交于智能体数量缩放(https://huggingface.co/papers?q=agent-count%20scaling)并可与之组合使用。
查看arXiv页面(https://arxiv.org/abs/2606.05158)查看PDF(https://arxiv.org/pdf/2606.05158)项目页面(https://zhenyangcs.github.io/StreamMA-website/)GitHub25(https://github.com/EnVision-Research/StreamMA)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05158)
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2606.05158即可从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2606.05158即可从本页面链接。
引用此论文的Space0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2606.05158即可从本页面链接。
包含此论文的收藏集1
相似文章
多智能体推理中的流式通信
StreamMA 提出了一种用于多智能体推理的流式通信范式,通过管道化中间结果来降低延迟,并利用更可靠的早期步骤提升效果,在多个基准测试中优于基线方法,同时揭示了步骤级别的缩放定律。
StreamMemBench:面向未来辅助的代理记忆流式评估
StreamMemBench是一个新的流式基准测试,用于评估个人代理记忆系统如何利用观察到的证据和用户反馈来实现面向未来的辅助。实验表明,当前系统通常无法将存储的信息转化为可靠的后续行为。
AgentStream:自进化LLM智能体在流式任务下表现如何?
AgentStream引入了一个统一框架,用于在流式任务场景下评估自进化LLM智能体,结果表明自进化的可靠性在不同场景下有所差异,并受模型能力制约。
X-Stream: 探索将MLLMs作为多流理解的多路复用器
X-Stream 引入了首个多流视频理解基准,将MLLMs作为多路复用器在多个并发流中进行评估。研究表明,当前MLLMs仅能达到约50%的准确率,暴露了处理多流时的显著局限性。
递归多智能体系统
本文提出RecursiveMAS,一种将递归扩展原则应用于多智能体系统的框架,以提升协作推理的效率和准确性。与标准基线相比,该框架在多个基准测试中实现了显著的加速和token缩减。