Aspire:模型能否从模糊目标中自我进化?
摘要
ASPIRE引入了一个基准,用于从模糊自然语言目标中自我进化的LLM代理,揭示了目标解释和稳定权重级别改进方面的挑战。
查看缓存全文
缓存时间: 2026/09/03 03:49
论文页面 - ASPIRE:模型能否从模糊目标实现自我进化?
来源:https://huggingface.co/papers/2608.31111 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
ASPIRE 引入了一个针对从模糊自然语言目标自我进化的LLM智能体基准,揭示了目标解释、数据选择以及稳定权重级改进方面的挑战。
许多重要的人类学习形式始于模糊的目标,例如“成为更好的物理学家”或“提升研究能力”。学习者必须解读目标、识别能力缺口、决定如何学习,并判断自己是否真正有所进步。相比之下,现有的LLM自我进化工作(https://huggingface.co/papers?q=LLM%20self-evolution)通常以人类指定的任务和评估指标为起点,将自我进化简化为优化一个明确目标,而非决定学什么、如何学。我们推出了ASPIRE(https://huggingface.co/papers?q=ASPIRE),一个针对模糊目标驱动的自我进化(https://huggingface.co/papers?q=vague-goal-driven%20self-evolution)的基准。ASPIRE(https://huggingface.co/papers?q=ASPIRE)仅提供一个自然语言能力目标,而下游评估任务则隐藏不公开。智能体必须通过选择数据与更新方法、构建训练与验证信号以及决定何时进行评估,来将目标付诸实践。ASPIRE(https://huggingface.co/papers?q=ASPIRE)在一个统一的交互式环境中支持模型权重和智能体框架的进化(https://huggingface.co/papers?q=agent-harness%20evolution),并在一个由专家编写的、涵盖六个目标、包含520个项目的隐藏评估集上评估结果系统。我们的实验表明,模糊目标将搜索努力重定向至目标解释。当前的智能体能够常规地完成训练和框架编辑循环,但权重级的提升仍然稀少且不稳定,并且进化出的最强框架仍低于工程化的Qwen-Agent参考基线。智能体常在不匹配的数据上进行训练,并依赖狭隘的自我评估(https://huggingface.co/papers?q=self-evaluation),因此局部收益无法转移到隐藏评估(https://huggingface.co/papers?q=hidden%20evaluation)中,持续的搜索和训练可能会抹去早期的改进。
查看 arXiv 页面 (https://arxiv.org/abs/2608.31111)查看 PDF (https://arxiv.org/pdf/2608.31111)项目主页 (https://self-developing-agents.github.io/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31111)
将此论文添加到你的智能体中:
hf papers read 2608\.31111
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.31111 以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.31111 以从此页面链接。
引用此论文的空间0
无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.31111 以从此页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化
# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,
# SAGE:面向自进化智能体的统计接受门
论文提出了 SAGE,这是一个针对 LLM 智能体的统计性接受门槛(statistical acceptance gate)。该智能体通过编辑持久化的技能文档实现自我进化;SAGE 采用逐样本配对比较与单侧配对检验,以防止性能回退并规避“优化者的诅咒”(Optimizer's Curse)。在五个基准测试与四个骨干 LLM 上,SAGE 均实现了更低的回退率和更高的得分。
@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
AgentStream:自进化LLM智能体在流式任务下表现如何?
AgentStream引入了一个统一框架,用于在流式任务场景下评估自进化LLM智能体,结果表明自进化的可靠性在不同场景下有所差异,并受模型能力制约。