AgentStream:自进化LLM智能体在流式任务下表现如何?

Hugging Face Daily Papers 论文

摘要

AgentStream引入了一个统一框架,用于在流式任务场景下评估自进化LLM智能体,结果表明自进化的可靠性在不同场景下有所差异,并受模型能力制约。

大型语言模型(LLM)智能体可以通过不断从自身积累的经验中学习来实现自进化。然而,现有研究主要采用独立评估方式。因此,自进化智能体在现实流式环境中的行为——即智能体适应多样且复杂的任务流——仍然鲜为人知。为弥补这一空白,我们提出了AgentStream,这是一个统一框架,通过将智能体基准测试组织为可配置的任务流,并在测试时实例化隔离、顺序和交错三种流式场景(这些场景逐步变化任务流的范围和领域组成),来评估涵盖不同进化组件的自进化智能体。在这些场景下,我们对五种代表性自进化方法在三个前沿基础模型上进行了组合式评估,厘清了模型能力、方法架构和流式场景如何共同塑造自进化过程。结果表明,自进化的可靠性在不同流式场景下存在差异,自进化的收益受模型能力制约且与模型强度呈非单调关系,没有单一方法能在所有模型和场景中占据主导地位。这些发现为在不同模型和流式场景下选择自进化方法提供了具体指导。总体而言,我们主张自进化智能体应在现实任务流下进行评估,而非孤立的单任务设置。
查看原文
查看缓存全文

缓存时间: 2026/08/05 01:42

论文页面 - AgentStream:自我进化的 LLM 智能体在流式任务下表现如何?

来源:https://huggingface.co/papers/2608.00155

摘要

大型语言模型(LLM)智能体可以通过不断从自身积累的经验中改进来实现自我进化。然而,现有研究主要采用独立评估。因此,在现实的流式设置中——智能体需要适应多样且复杂的任务流——自我进化智能体的行为仍然鲜为人知。为了弥补这一空白,我们提出了 AgentStream,一个统一框架,通过将智能体基准测试组织为可配置的任务流,并在测试时实例化隔离(Isolated)、顺序(Sequential)和交错(Interleaved)三种流式场景(这些场景逐步改变任务流的范围和领域构成),来评估涵盖不同进化组件的自我进化智能体。在这些场景中,我们对三个前沿基础模型上的五种代表性自我进化方法进行了组合评估,厘清了模型能力、方法架构和流式场景如何共同塑造自我进化。我们的结果表明,自我进化的可靠性在不同流式场景间存在差异;自我进化的收益受模型能力限制,且对模型强度呈非单调关系;没有任何单一方法能在所有模型和场景中占优。这些发现为在不同模型和流式场景下选择自我进化方法提供了具体指导。总体而言,我们主张自我进化智能体应在现实任务流而非隔离的单一任务设置下进行评估。

查看 arXiv 页面 查看 PDF GitHub 添加到收藏

在您的智能体中获取该论文:

hf papers read 2608.00155

没有最新 CLI?

curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.00155,即可从此页面链接到它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.00155,即可从此页面链接到它。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.00155,即可从此页面链接到它。

包含此论文的集合 0

没有集合包含此论文

将此论文添加到集合(https://huggingface.co/new-collection)以从此页面链接到它。

相似文章

CoEvolve:通过智能体-数据互进化训练LLM智能体

arXiv cs.CL

CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。

OpenSkill:LLM智能体的开放世界自进化

Hugging Face Daily Papers

OpenSkill是一个框架,让LLM智能体能够从开放世界资源中自进化技能和验证信号,无需目标任务监督,在多个基准测试中实现高性能。

通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化

Hugging Face Daily Papers

# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,