PAST-Bench:对个人智能体中递归自我改进基础的基准测试
摘要
介绍了 PAST-Bench,一个用于评估个人 AI 智能体是否能够通过跨会话保留的经验得到改进的基准,以及 Hermes+,一个带有针对性干预措施的扩展。发现改进是真实的,但在不同能力和模型之间并不均衡。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - PAST-Bench:对个人智能体中递归自我改进基础的基准测试
来源:https://huggingface.co/papers/2608.04003
摘要
递归自我改进要求智能体将积累的经验转化为更好的未来行为。个人AI智能体为研究这一能力提供了一个具体场景,因为它们在多次会话中会保留偏好、任务历史、工具例程和学习到的技能。然而,保留的经验是否真的能随着时间推移改善智能体,尚未得到系统性的测试。我们提出了PAST-Bench,一个专门用于隔离这一问题的基准。每个智能体在匹配条件下按顺序执行一系列全新会话任务,并开启或关闭经验保留功能。该基准涵盖26个场景和204个回合,涉及记忆、程序复用、信息收集和更新。我们报告了后续任务的增益,以及这些增益是否遵循预期的保存、检索和更新路径。在七个基础模型和四个智能体框架中,改进是真实的,但各能力之间并不均衡。具有相同总体增益的智能体,在增益是否得到预期路径证据支持方面可能存在显著差异。在这些发现的指导下,我们开发了Hermes+,它在智能体循环的各阶段扩展了Hermes,加入了五项针对性干预措施。Hermes+提高了从保留经验中获得的平均增益,并提供了更清晰的路径证据,其在需要替换过时状态的任务上改进最为显著,尽管效果仍然依赖于能力和模型。总之,PAST-Bench和Hermes+为研究持久化智能体如何从保留经验发展为通过经验进行系统性改进,提供了评估和诊断基础。代码:https://github.com/Gen-Verse/PAST-Bench
查看 arXiv 页面 (https://arxiv.org/abs/2608.04003) 查看 PDF (https://arxiv.org/pdf/2608.04003) GitHub2 (https://github.com/Gen-Verse/PAST-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04003)
在你的智能体中获取这篇论文:
hf papers read 2608\.04003
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.04003,即可从本页链接到它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.04003,即可从本页链接到它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.04003,即可从本页链接到它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。
相似文章
FinPersona-Bench: 自主金融代理纵向心理测量稳定性基准
介绍了FinPersona-Bench,这是一个用于衡量自主金融代理如何随时间保持其指定行为指令的基准,揭示了任务显著性衰减(MSD),这种衰减随时间距离增加而加剧,并因模型和代理特征而异。
HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
SkillEvolBench:从情景经验到程序技能的进化基准测试
SkillEvolBench 是一个诊断性基准,用于评估大语言模型代理是否能够将情景经验提炼为可重用的程序技能。它包含六个环境中的180个任务,并发现当前代理通常难以形成稳健的可重用技能,原始轨迹重用往往优于提炼后的技能。
递归自我改进的首个实验证据(3分钟阅读)
研究人员展示了AIDE²,这是一个具有递归自动研究循环的系统,在超过100次迭代中改进了自己的代码,发现了七项改进,并在保留的基准测试上击败了手动调优的智能体。
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。