@XuXander24218:StreamMA:让多智能体系统更快更准确!大家好!我们的团队刚刚发布了StreamMA。它是一个…

X AI KOLs Following 论文

摘要

StreamMA是一种多智能体推理系统,它逐步流式传输中间结果以改善延迟和准确性,在基准测试中实现了高达26.9倍的加速和+7.3%的性能提升。

StreamMA:让多智能体系统更快更准确! 大家好!我们的团队刚刚发布了StreamMA。这是一种让多智能体系统既更快又更准确的新方法。核心思想简单而强大:不再等待某个智能体完成完整回复,而是逐步发送信息。每个推理步骤会立刻传递给下一个智能体。 为什么这么有效? 上游智能体发送一步,下游智能体立即开始工作。这大大提升了速度。令人惊讶的是,推理质量也提高了。复杂的推理步骤质量各不相同。早期步骤通常可靠且清晰,后期步骤更可能出错。StreamMA让下游智能体从好的早期步骤开始。当错误到达时,其他智能体已经构建了它们自己的强推理路径。这自然减少了错误的影响。 主要贡献: ① 流式协议:我们将通信从完整回复改为单步传输。这既提升了速度也提升了性能。 ② 三个封闭形式定理:我们展示了Stream效果最优的条件、理论加速上限和成本比。 ③ 步骤级缩放规律:在相同智能体数量下,增加步骤数能同时提升准确率和速度。这与传统的智能体缩放配合良好。 强大的实验结果: • 性能:在8个数学、科学和代码基准测试中平均提升+7.3个百分点(Opus 4.6) • 加速:使用64个智能体和64个步骤时,我们实现了26.9倍的推理加速(理论最大值32.3倍,达到了83%)(HMMT26 GPT5.4) 想了解更多? 论文:https://huggingface.co/papers/2606.05158… 项目页面:https://zhenyangcs.github.io/StreamMA-website… GitHub:https://github.com/EnVision-Research/StreamMA… 如果你从事多智能体系统、分布式推理或长链推理工作,我们很期待听到你的想法!这种流式思路带来了新的可能性。 #StreamMA #MultiAgent #AI #Reasoning #LLM
查看原文
查看缓存全文

缓存时间: 2026/06/05 13:17

StreamMA:让多智能体系统更快更准!

大家好!我们的团队刚刚发布了StreamMA。这是一种让多智能体系统既更快又更准确的新方法。核心思想简单但强大:不再等待一个智能体完成它的完整响应,而是逐步发送信息。每一个推理步骤都立即传递给下一个智能体。

为什么这样做效果这么好? 上游智能体发送一个步骤,下游智能体立即开始工作。这使得一切变得更快。令人惊讶的是,推理质量也变得更好了。复杂的推理步骤并非全部质量相同。早期步骤通常可靠且清晰。后期步骤更可能包含错误。StreamMA让下游智能体从可靠的早期步骤开始工作。等到错误出现时,其他智能体已经构建了自己强有力的推理路径。这自然减少了错误的影响。

关键贡献: 1 流协议:我们将通信从完整响应转变为单个步骤。这同时提升了速度和性能。 2 三个封闭形式定理:我们展示了Stream在何时效果最佳、理论加速上限以及成本比率。 3 步骤级缩放定律:在相同智能体数量下,增加步骤数同时提升准确性和速度。它与传统的智能体数量缩放配合得很好。

强大的实验结果: • 性能:在8个数学、科学和代码基准测试上平均提升+7.3个百分点(Opus 4.6) • 加速:使用64个智能体和64个步骤,我们获得了26.9倍推理加速(理论上限为32.3倍,我们达到了83%)(HMMT26 GPT5.4)

想了解更多? 论文:https://huggingface.co/papers/2606.05158… 项目页面:https://zhenyangcs.github.io/StreamMA-website… GitHub:https://github.com/EnVision-Research/StreamMA…

如果您从事多智能体系统、分布式推理或长链推理方面的工作,我们非常期待听到您的想法!这种流式思路带来了新的可能性。 #StreamMA #多智能体 #AI #推理 #LLM


论文页面 - 多智能体推理中的流式通信

来源:https://huggingface.co/papers/2606.05158

摘要

StreamMA通过流式传输中间结果,并利用可靠的早期步骤来缩短延迟并提升效果,从而在各种推理任务中实现高效的多智能体推理。

多智能体推理系统(https://huggingface.co/papers?q=Multi-agent%20reasoning%20systems)采用“生成-传输”范式,导致端到端延迟(https://huggingface.co/papers?q=end-to-end%20latency)随流水线深度线性增长。我们引入了StreamMA,一个多智能体推理系统,它在生成每个推理步骤后立即流式传输给下游智能体,对相邻智能体进行流水线化(https://huggingface.co/papers?q=pipelining),从而减少延迟。令人惊讶的是,这种流水线化(https://huggingface.co/papers?q=pipelining)也提升了效果:因为多步推理质量是非均匀的,早期步骤比后期步骤更可靠,使用这些可靠的早期步骤而不是完整链(https://huggingface.co/papers?q=chain),可以防止可能出错的后期步骤误导下游智能体。我们通过第一个针对流协议、串行协议和单协议(https://huggingface.co/papers?q=single%20protocol)的封闭形式联合分析,形式化地展示了这两种优势,推导出效果排序(https://huggingface.co/papers?q=effectiveness%20ordering)、加速上限(https://huggingface.co/papers?q=speedup%20upper%20bound)和成本比率(https://huggingface.co/papers?q=cost%20ratio)。在涵盖数学、科学和代码的八个推理基准测试(https://huggingface.co/papers?q=reasoning%20benchmarks)中,使用两个前沿LLMs(https://huggingface.co/papers?q=LLMs)(Claude Opus 4.6 和 GPT-5.4)以及三种拓扑(链Chain(https://huggingface.co/papers?q=Chain)、树Tree(https://huggingface.co/papers?q=Tree)、图Graph(https://huggingface.co/papers?q=Graph)),StreamMA在两个基线上均表现更优(平均+7.3个百分点,在HMMT 2026上最高+22.4个百分点;Claude Opus 4.6-high)。除这些贡献外,我们还发现了一个“步骤级缩放定律(https://huggingface.co/papers?q=step-level%20scaling%20law)”:增加每个智能体的步骤数持续提升效果和效率,这是一个新的缩放维度,正交于智能体数量缩放(https://huggingface.co/papers?q=agent-count%20scaling)并可与之组合使用。

查看arXiv页面(https://arxiv.org/abs/2606.05158)查看PDF(https://arxiv.org/pdf/2606.05158)项目页面(https://zhenyangcs.github.io/StreamMA-website/)GitHub25(https://github.com/EnVision-Research/StreamMA)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05158)

引用此论文的模型0

没有模型链接此论文

在模型的README.md中引用arxiv.org/abs/2606.05158即可从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2606.05158即可从本页面链接。

引用此论文的Space0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2606.05158即可从本页面链接。

包含此论文的收藏集1

相似文章

多智能体推理中的流式通信

Hugging Face Daily Papers

StreamMA 提出了一种用于多智能体推理的流式通信范式,通过管道化中间结果来降低延迟,并利用更可靠的早期步骤提升效果,在多个基准测试中优于基线方法,同时揭示了步骤级别的缩放定律。

StreamMemBench:面向未来辅助的代理记忆流式评估

arXiv cs.AI

StreamMemBench是一个新的流式基准测试,用于评估个人代理记忆系统如何利用观察到的证据和用户反馈来实现面向未来的辅助。实验表明,当前系统通常无法将存储的信息转化为可靠的后续行为。

X-Stream: 探索将MLLMs作为多流理解的多路复用器

Hugging Face Daily Papers

X-Stream 引入了首个多流视频理解基准,将MLLMs作为多路复用器在多个并发流中进行评估。研究表明,当前MLLMs仅能达到约50%的准确率,暴露了处理多流时的显著局限性。

递归多智能体系统

Papers with Code Trending

本文提出RecursiveMAS,一种将递归扩展原则应用于多智能体系统的框架,以提升协作推理的效率和准确性。与标准基线相比,该框架在多个基准测试中实现了显著的加速和token缩减。