PAST-Bench:对个人智能体中递归自我改进基础的基准测试

Hugging Face Daily Papers 论文

摘要

介绍了 PAST-Bench,一个用于评估个人 AI 智能体是否能够通过跨会话保留的经验得到改进的基准,以及 Hermes+,一个带有针对性干预措施的扩展。发现改进是真实的,但在不同能力和模型之间并不均衡。

递归自我改进要求智能体将积累的经验转化为更好的未来行为。个人 AI 智能体为研究这一能力提供了具体场景,因为它们会在多次会话中保留偏好、任务历史、工具例程和习得技能。然而,保留的经验是否真的能随时间的推移改进它们,尚未得到系统性测试。我们引入了 PAST-Bench,一个专门用于隔离这一问题的基准。每个智能体在匹配条件下运行有序的新会话任务序列,这些条件会开启或关闭保留经验。该基准涵盖 26 个场景和 204 个回合,涉及记忆、程序复用、信息收集和更新。我们既报告后期任务的增益,也报告这些增益是否遵循预期的保存、检索和更新路径。在七个基础模型和四个智能体框架中,改进是真实的,但在不同能力上并不均衡。具有相同总体增益的智能体,其增益是否得到预期路径证据的支持,可能存在显著差异。在这些发现的指导下,我们开发了 Hermes+,它在智能体循环的各阶段扩展了 Hermes,加入了五项针对性干预措施。Hermes+ 提高了从保留经验中获得的平均增益,并提供了更清晰的路径证据,其最强改进体现在需要替换过时状态的任务上,尽管该效果仍然依赖于能力和模型。总之,PAST-Bench 和 Hermes+ 为研究持久型智能体如何从保留经验发展到系统性改进提供了评估和诊断基础。代码:https://github.com/Gen-Verse/PAST-Bench
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - PAST-Bench:对个人智能体中递归自我改进基础的基准测试

来源:https://huggingface.co/papers/2608.04003

摘要

递归自我改进要求智能体将积累的经验转化为更好的未来行为。个人AI智能体为研究这一能力提供了一个具体场景,因为它们在多次会话中会保留偏好、任务历史、工具例程和学习到的技能。然而,保留的经验是否真的能随着时间推移改善智能体,尚未得到系统性的测试。我们提出了PAST-Bench,一个专门用于隔离这一问题的基准。每个智能体在匹配条件下按顺序执行一系列全新会话任务,并开启或关闭经验保留功能。该基准涵盖26个场景和204个回合,涉及记忆、程序复用、信息收集和更新。我们报告了后续任务的增益,以及这些增益是否遵循预期的保存、检索和更新路径。在七个基础模型和四个智能体框架中,改进是真实的,但各能力之间并不均衡。具有相同总体增益的智能体,在增益是否得到预期路径证据支持方面可能存在显著差异。在这些发现的指导下,我们开发了Hermes+,它在智能体循环的各阶段扩展了Hermes,加入了五项针对性干预措施。Hermes+提高了从保留经验中获得的平均增益,并提供了更清晰的路径证据,其在需要替换过时状态的任务上改进最为显著,尽管效果仍然依赖于能力和模型。总之,PAST-Bench和Hermes+为研究持久化智能体如何从保留经验发展为通过经验进行系统性改进,提供了评估和诊断基础。代码:https://github.com/Gen-Verse/PAST-Bench

查看 arXiv 页面 (https://arxiv.org/abs/2608.04003) 查看 PDF (https://arxiv.org/pdf/2608.04003) GitHub2 (https://github.com/Gen-Verse/PAST-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04003)

在你的智能体中获取这篇论文:

hf papers read 2608\.04003

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.04003,即可从本页链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.04003,即可从本页链接到它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.04003,即可从本页链接到它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。

相似文章

SkillEvolBench:从情景经验到程序技能的进化基准测试

Hugging Face Daily Papers

SkillEvolBench 是一个诊断性基准,用于评估大语言模型代理是否能够将情景经验提炼为可重用的程序技能。它包含六个环境中的180个任务,并发现当前代理通常难以形成稳健的可重用技能,原始轨迹重用往往优于提炼后的技能。

递归自我改进的首个实验证据(3分钟阅读)

TLDR AI

研究人员展示了AIDE²,这是一个具有递归自动研究循环的系统,在超过100次迭代中改进了自己的代码,发现了七项改进,并在保留的基准测试上击败了手动调优的智能体。