Aspire:模型能否从模糊目标中自我进化?

Hugging Face Daily Papers 论文

摘要

ASPIRE引入了一个基准,用于从模糊自然语言目标中自我进化的LLM代理,揭示了目标解释和稳定权重级别改进方面的挑战。

许多重要的人类学习形式始于一个模糊的目标,例如“成为更好的物理学家”或“提高研究能力”。学习者必须解释目标,识别能力差距,决定如何学习,并确定自己是否真的有所进步。相比之下,现有的关于LLM自我进化的研究通常从人类指定的任务和评估指标开始,将自我进化简化为优化一个明确的目标,而不是决定学什么和怎么学。我们引入ASPIRE,一个由模糊目标驱动的自我进化基准。ASPIRE仅提供一个自然语言的能力目标,而下游评估任务保持隐藏。代理必须通过选择数据和更新方法、构建训练和验证信号以及决定何时评估来将目标操作化。ASPIRE在一个统一的交互式环境中支持模型权重和代理框架的进化,并在一个隐藏的、专家编写的包含520个项目、涵盖六个目标的集合上评估生成的系统。我们的实验表明,模糊目标将搜索努力转向目标解释。当前代理通常能完成训练和框架编辑循环,但权重级别的增益仍然稀少且不稳定,并且最强的进化框架仍低于工程化的Qwen-Agent参考。代理经常在不匹配的数据上训练,并信任狭窄的自我评估,因此局部增益无法转移到隐藏评估,并且持续的搜索和训练可能会消除早期的改进。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:49

论文页面 - ASPIRE:模型能否从模糊目标实现自我进化?

来源:https://huggingface.co/papers/2608.31111 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

ASPIRE 引入了一个针对从模糊自然语言目标自我进化的LLM智能体基准,揭示了目标解释、数据选择以及稳定权重级改进方面的挑战。

许多重要的人类学习形式始于模糊的目标,例如“成为更好的物理学家”或“提升研究能力”。学习者必须解读目标、识别能力缺口、决定如何学习,并判断自己是否真正有所进步。相比之下,现有的LLM自我进化工作(https://huggingface.co/papers?q=LLM%20self-evolution)通常以人类指定的任务和评估指标为起点,将自我进化简化为优化一个明确目标,而非决定学什么、如何学。我们推出了ASPIRE(https://huggingface.co/papers?q=ASPIRE),一个针对模糊目标驱动的自我进化(https://huggingface.co/papers?q=vague-goal-driven%20self-evolution)的基准。ASPIRE(https://huggingface.co/papers?q=ASPIRE)仅提供一个自然语言能力目标,而下游评估任务则隐藏不公开。智能体必须通过选择数据与更新方法、构建训练与验证信号以及决定何时进行评估,来将目标付诸实践。ASPIRE(https://huggingface.co/papers?q=ASPIRE)在一个统一的交互式环境中支持模型权重和智能体框架的进化(https://huggingface.co/papers?q=agent-harness%20evolution),并在一个由专家编写的、涵盖六个目标、包含520个项目的隐藏评估集上评估结果系统。我们的实验表明,模糊目标将搜索努力重定向至目标解释。当前的智能体能够常规地完成训练和框架编辑循环,但权重级的提升仍然稀少且不稳定,并且进化出的最强框架仍低于工程化的Qwen-Agent参考基线。智能体常在不匹配的数据上进行训练,并依赖狭隘的自我评估(https://huggingface.co/papers?q=self-evaluation),因此局部收益无法转移到隐藏评估(https://huggingface.co/papers?q=hidden%20evaluation)中,持续的搜索和训练可能会抹去早期的改进。

查看 arXiv 页面 (https://arxiv.org/abs/2608.31111)查看 PDF (https://arxiv.org/pdf/2608.31111)项目主页 (https://self-developing-agents.github.io/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31111)

将此论文添加到你的智能体中:

hf papers read 2608\.31111

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.31111 以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.31111 以从此页面链接。

引用此论文的空间0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.31111 以从此页面链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化

Hugging Face Daily Papers

# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,

# SAGE:面向自进化智能体的统计接受门

arXiv cs.AI

论文提出了 SAGE,这是一个针对 LLM 智能体的统计性接受门槛(statistical acceptance gate)。该智能体通过编辑持久化的技能文档实现自我进化;SAGE 采用逐样本配对比较与单侧配对检验,以防止性能回退并规避“优化者的诅咒”(Optimizer's Curse)。在五个基准测试与四个骨干 LLM 上,SAGE 均实现了更低的回退率和更高的得分。