EVOCHAMBER: 测试时多智能体系统在个体、团队和群体层面的协同进化

Hugging Face Daily Papers 论文

摘要

EVOCHAMBER是一个无需训练的多智能体测试时进化框架,通过在个体、团队和群体层面的协作反思与非对称知识转移实现涌现式专业化,在数学、编程和推理任务上取得了显著提升。

我们认为多智能体测试时进化并非单智能体进化的N次重复。单智能体学习器只能进化自身的上下文和记忆。而多智能体系统额外进化了谁在协作、如何协作以及知识如何在群体中流动。这些成分在单智能体中并不存在,可能产生涌现式专业化等现象。然而,先前的测试时方法要么将经验限制在单个智能体,放弃跨智能体学习,要么对称地向所有智能体广播,抹去了使协作有价值的专业化。我们提出了EVOCHAMBER,一个无需训练的框架,在共进化的智能体池上的三个层次上实现测试时进化。其核心是CODREAM(协作梦想),一个在团队失败或分歧时触发的任务后协议,智能体在其中协作反思、提炼见解,并沿着失败领域从强智能体到弱智能体进行非对称路由,既保持专业化又填补知识空白。团队级算子在线组装基于领域的团队并选择协作结构。群体级生命周期算子在性能压力下进行分支、合并、修剪和播种智能体。在使用Qwen3-8B的三个异构任务流上,EVOCHAMBER在竞赛数学上达到63.9%,在编程上达到75.7%,在多领域推理上达到87.1%,在数学上相对最佳基线提升32%,并通过消融实验确认非对称跨智能体转移是主要驱动因素。从几个初始相同的智能体开始,会自发涌现出四到五个稳定的领域专家,这是多智能体进化的结构特征,而任何单智能体学习器都无法表达。代码见:https://github.com/Mercury7353/EvoChamber
查看原文
查看缓存全文

缓存时间: 2026/05/14 00:15

论文页面 - EVOCHAMBER:个体、团队与群体尺度上多智能体系统的测试时协同进化

来源:https://huggingface.co/papers/2605.11136

摘要

多智能体测试时进化框架 EVOCHAMBER 通过协同反思与跨协同进化智能体的非对称知识迁移,实现了涌现性专业化。

我们认为,多智能体测试时进化 (https://huggingface.co/papers?q=multi-agent%20test-time%20evolution) 并非单智能体进化 (https://huggingface.co/papers?q=single-agent%20evolution) 的 N 次简单复制。单智能体学习器只能进化自身的上下文和记忆。而多智能体系统还能额外进化谁与谁协作、如何协作以及知识如何在群体中流动。这些组件在单智能体中并无对应物,并能产生诸如涌现性专业化 (https://huggingface.co/papers?q=emergent%20specialization) 等现象。然而,先前的测试时方法要么将经验限制在单个智能体内,放弃了跨智能体学习;要么对称地广播给所有智能体,抹杀了使协作有价值的专业化。我们提出 EVOCHAMBER,这是一个无需训练的框架,在协同进化智能体池 (https://huggingface.co/papers?q=coevolving%20agent%20pool) 上于三个层次实例化测试时进化。其核心是 CODREAM (https://huggingface.co/papers?q=CODREAM)(协同梦想 (https://huggingface.co/papers?q=Collaborative%20Dreaming)),这是一个在团队失败或分歧时触发的任务后协议,智能体在其中协同反思、提炼见解,并将它们从擅长特定领域的强智能体非对称地路由到弱智能体,从而既保留专业化又填补知识空白。团队级操作符在线构建领域条件化团队 (https://huggingface.co/papers?q=niche-conditioned%20teams) 并选择协作结构 (https://huggingface.co/papers?q=collaboration%20structures)。群体级生命周期操作符 (https://huggingface.co/papers?q=Population-level%20lifecycle%20operators) 在性能压力下进行分叉、合并、剪枝和种子智能体操作。在三个异构任务流(使用 Qwen3-8B)上,EVOCHAMBER 在竞赛数学上达到 63.9%,在代码任务上达到 75.7%,在多领域推理上达到 87.1%,在数学任务上相对最佳基线提升 32%,消融实验证实非对称跨智能体转移是主要驱动因素。从若干初始化相同的智能体开始,四到五个稳定的领域专家自发涌现,这是多智能体进化的结构特征,任何单智能体学习器都无法表达。代码见:https://github.com/Mercury7353/EvoChamber

查看 arXiv 页面 (https://arxiv.org/abs/2605.11136) 查看 PDF (https://arxiv.org/pdf/2605.11136) GitHub1 (https://github.com/Mercury7353/EvoChamber) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.11136)

在你的智能体中获取此论文:

hf papers read 2605.11136

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2605.11136 即可从此页面链接。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.11136 即可从此页面链接。

引用此论文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2605.11136 即可从此页面链接。

包含此论文的收藏集 0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

EvoMaster:构建可进化大规模自主科学智能体的基础框架

Hugging Face Daily Papers

# 论文页面 - EvoMaster:构建可进化大规模自主科学智能体的基础框架 来源:[https://huggingface.co/papers/2604.17406](https://huggingface.co/papers/2604.17406) 作者:,,,,,,,,,,,,,,,,,,,,, ## 摘要 EvoMaster 是一个可扩展、自我进化的智能体框架,专为大规模科学发现设计,支持在实验周期中迭代优化假设并持续积累知识。大语言模型与智能体的融合正在催生“智能体科学”新时代。

EvoTest:面向自我改进智能体系统的进化式测试时学习

arXiv cs.CL

EvoTest 引入了 J-TTL,一个衡量智能体测试时学习能力的基准,并提出了一个进化框架,其中 Actor 智能体玩游戏,而 Evolver 智能体在不进行微调的情况下迭代改进系统的提示、记忆和超参数。该方法在基于复杂文本的游戏中表现出优于基于反思和记忆的基线方法的性能。

EvoScientist:面向端到端科学发现的多智能体进化AI科学家

Papers with Code Trending

EvoScientist 是一个用于端到端科学发现的自适应多智能体框架,通过持久化记忆模块持续改进,由三个专业智能体组成,分别负责创意生成、实验执行和知识提炼。它在科学创意生成方面超越了7个当前最先进的系统,并通过多智能体进化提升了代码执行成功率。