AgentStream:自进化LLM智能体在流式任务下表现如何?
摘要
AgentStream引入了一个统一框架,用于在流式任务场景下评估自进化LLM智能体,结果表明自进化的可靠性在不同场景下有所差异,并受模型能力制约。
查看缓存全文
缓存时间: 2026/08/05 01:42
论文页面 - AgentStream:自我进化的 LLM 智能体在流式任务下表现如何?
来源:https://huggingface.co/papers/2608.00155
摘要
大型语言模型(LLM)智能体可以通过不断从自身积累的经验中改进来实现自我进化。然而,现有研究主要采用独立评估。因此,在现实的流式设置中——智能体需要适应多样且复杂的任务流——自我进化智能体的行为仍然鲜为人知。为了弥补这一空白,我们提出了 AgentStream,一个统一框架,通过将智能体基准测试组织为可配置的任务流,并在测试时实例化隔离(Isolated)、顺序(Sequential)和交错(Interleaved)三种流式场景(这些场景逐步改变任务流的范围和领域构成),来评估涵盖不同进化组件的自我进化智能体。在这些场景中,我们对三个前沿基础模型上的五种代表性自我进化方法进行了组合评估,厘清了模型能力、方法架构和流式场景如何共同塑造自我进化。我们的结果表明,自我进化的可靠性在不同流式场景间存在差异;自我进化的收益受模型能力限制,且对模型强度呈非单调关系;没有任何单一方法能在所有模型和场景中占优。这些发现为在不同模型和流式场景下选择自我进化方法提供了具体指导。总体而言,我们主张自我进化智能体应在现实任务流而非隔离的单一任务设置下进行评估。
查看 arXiv 页面 查看 PDF GitHub 添加到收藏
在您的智能体中获取该论文:
hf papers read 2608.00155
没有最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.00155,即可从此页面链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.00155,即可从此页面链接到它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.00155,即可从此页面链接到它。
包含此论文的集合 0
没有集合包含此论文
将此论文添加到集合(https://huggingface.co/new-collection)以从此页面链接到它。
相似文章
CoEvolve:通过智能体-数据互进化训练LLM智能体
CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。
OpenSkill:LLM智能体的开放世界自进化
OpenSkill是一个框架,让LLM智能体能够从开放世界资源中自进化技能和验证信号,无需目标任务监督,在多个基准测试中实现高性能。
生产环境中的高效基准测试:一项演化LLM代理研究
本文探索生产环境中LLM代理的高效重复评估方法,比较自适应测试和固定子集等技术,并提供部署的实用建议。
ContinualSkillBench:LLM智能体能否真正进化其能力?
介绍了ContinualSkillBench,一个用于LLM智能体上下文内持续技能学习的动态评估框架,表明虽然顺序执行能提升性能,但当前方法难以将经验巩固为稳健、可迁移的技能。
通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化
# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,