AhaBench:智能体是否从先前经验中学习?一个用于长期持续学习的基准
摘要
AhaBench 是一个基准测试套件,通过测试探索、知识转移和延迟反馈处理,评估语言智能体在长期任务中是否从先前经验中改进。
arXiv:2609.05435v1 公告类型:新
摘要:现代语言智能体被期望在长期范围内操作:它们提出后续问题、重用已解决的示例、处理工具反馈,并适应延迟的后果。大多数评估仍然在提示后重置智能体,或仅对单个轨迹的最终状态进行评分。AhaBench 提出了一个更具操作性的问题:当一个固定模型接收到有用的经验时,在显而易见的支撑被移除、改变或延迟的相关评估条件下,其后续行为是否会改进?该套件包含三个组件。Aha-Puzzle 测试解决隐状态谜题后的无提示探索;Aha-Euler 将 Project-Euler 风格的数学思想转化为生成的教学/保留任务,并带有精确验证器;Aha-Vending,一个受 Vending-Bench 启发的开源实现,测试模拟的自动售货智能体在处理延迟反馈和操作事件时是否保持盈利。AhaBench 报告一个三部分的记分卡:初始分数衡量起始能力,经验后分数衡量后续实证结果,学习提升是它们的差值。这种分解是主要的经验信息:那些良好使用可见支撑的模型、达到高经验后分数的模型以及在运行中改进最大的模型并不总是相同的。在常见的八个模型面板中,Claude Opus 4.6 以 64.3 的总经验后分数和 +25.8 的总学习提升领先,Gemini 3.1 Pro 以 63.4 紧随其后。组件结果解释了这种分歧:谜题轨迹提高了支持分数,但往往未能转化为无提示探索行为;Aha-Euler 的完整教学达到 78.6-100.0%,而仅答案转移范围从 0.0 到 73.9%;Aha-Vending 将盈利的事件处理与破产和无订单失败区分开来。我们发布基准任务、评分标准、验证器、模拟器代码以及用于评估新智能体的接口。
查看缓存全文
缓存时间: 2026/09/10 08:21
# 智能体能否从先前经验中学习?面向长期持续学习的基准测试 来源:https://arxiv.org/html/2609.05435 \\setlogo![[未标注图片]](https://arxiv.org/html/2609.05435v1/figures/hy-logo.png) x![[未标注图片]](https://arxiv.org/html/2609.05435v1/figures/PU_lockup.jpg) Jiawei Xu2,3Huacan Chai2,4Jiayang Sun1,5Pramod Viswanath1Maxm Pan2,† 1普林斯顿大学2腾讯混元3清华大学 4上海交通大学5香港大学 链接:Github仓库 (https://github.com/Marco-Cheng/AhaBench) ###### 摘要 现代语言智能体需要在更长的任务周期中运作:它们需要提出后续问题、重用已有示例、处理工具反馈,并适应延迟产生的后果。现有大多数评估仍会在单次提示后重置智能体,或仅对单条轨迹的最终状态进行评分。AhaBench提出了一个更具操作性的问题:当一个固定模型获得有用经验后,在相关的评估条件下(其中明显的支持已被移除、改变或延迟),其后续行为是否得到改善?该测试套件包含三个组件。Aha-Puzzle测试在解决隐藏状态谜题后的无提示探索;Aha-Euler将Project-Euler风格的数学思想转化为可生成的教学/保留任务,并配备精确验证器;Aha-Vending则是一个受Vending-Bench启发的开源实现,用于测试模拟的自动售货智能体在处理延迟反馈和运营事件时能否保持盈利。AhaBench报告一个三部分评分卡:初始分数衡量起始能力,经验后分数衡量后续实证结果,学习提升度是两者的差值。这种分解是主要的经验发现:善于利用可见支持的模型、达到高经验后分数的模型,以及在运行过程中改进最大的模型并不总是相同的。在常见的八模型面板中,Claude Opus 4.6在汇总经验后分数(64.3)和汇总学习提升度(+25.8)上领先,Gemini 3.1 Pro紧随其后(63.4)。组件结果解释了这种差异:谜题轨迹能提高有支持时的分数,但往往无法转化为无提示探索行为;Aha-Euler的完整教学达到78.6–100.0%,而仅答案的迁移范围从0.0%到73.9%不等;Aha-Vending则区分了处理事件时的盈利与破产及无订单失败。我们发布了基准任务、评分标准、生成器、验证器、模拟器代码以及用于评估新智能体的模型评估接口。 ††∗工作完成于腾讯混元。†††通讯作者:Zerui Cheng, [[email protected]](mailto:[email protected]), Maxm Pan [[email protected]](mailto:[email protected])\。## 1引言 许多应用需要一个在运行过程中持续改进的智能体,而不仅仅是在首次提示时表现强大的智能体。故障排除智能体应在阅读日志后避免失败查询;数学智能体应在解决一个实例后重用思路;商业智能体应在获得关于需求的延迟证据后改变库存和定价。本文中,“顿悟”时刻被行为性地定义为:同一个固定模型在后期表现更好,是因为早期经验提供了一个有用的教训。这个问题在标准评估中大多不可见。单次提示基准衡量存储的知识或即时推理能力。单条轨迹的智能体基准通常只对最终状态评分。两者都有用,但都没有区分实践中重要的三种情况:强大的初始能力、对可见提示的临时使用,以及在提示、代码或即时反馈被移除后的持久改进。我们研究固定权重设置,不进行微调或梯度更新;任何改进都必须来自上下文、记忆、工具状态或推理时推理。AhaBench使这种设置可测量。每个组件提供一个经验来源,然后测试一个相关的评估条件,该条件无法通过复制来源解决。支持的改变是故意的且特定于领域:Aha-Puzzle移除轨迹前缀,Aha-Euler改变输入但保留计算思路,Aha-Vending观察由早期决策引起的未来业务状态。因此,基准问题很具体:模型是否将早期经验作为可重用的策略?在整篇论文中,初始分数 BB 表示冷启动或早期分数,经验后分数 PP 表示相关经验后的后续分数,学习提升度是 Δ=P−B\\Delta=P\-B,即同一尺度上的变化。参见标题图1:AhaBench衡量什么。左图扩展了常见的“之前-经验-之后”结构:初始分数 BB 是直接的谜题解决、冷启动数学解决或早期售货利润;经验是已解轨迹、相关的教学任务或业务轨迹;经验后分数 PP 是无提示谜题终点、仅答案的保留任务或事件设置下的利润。右图报告按 PP 排序的汇总排行榜,学习提升度 Δ=P−B\\Delta=P\-B 在括号内。这三个组件旨在被视为同一问题的不同形式。Aha-Puzzle衡量在隐藏状态下的探索:智能体就一个情境谜题提出多达20个问题,接收主持人最简回答,在课程中研究已解片段,最后在没有轨迹前缀的情况下接受测试。Aha-Euler衡量可重用的数学推理:Project-Euler风格的问题被转化为可执行的生成任务,一个教学实例必须迁移到一个保留输入。Aha-Vending衡量操作控制:智能体通过阅读电子邮件、订购产品、填充货柜、设定价格、处理天气和事件,并在数百个模拟日中保持盈利,来运行一个模拟的自动售货业务。主要排行榜直接显示了这种分离。Claude Opus 4.6以64.3的经验后分数领先,其次是Gemini 3.1 Pro(63.4)和GPT-5.4(42.5)。提升度提供了不同的视角:Claude改进了+25.8,Hy3 Preview改进了+12.2,Gemini改进了+8.2。组件评分卡解释了原因:GPT-5.4在Aha-Euler经验后分数中领先,Qwen在Aha-Puzzle学习提升度上最强,而Claude在侧重事件的Aha-Vending评估中最强。因此,该基准对模型进行排名,但也指出了每个模型在后续行为中使用了哪种经验。贡献是一种用于长期智能体评估的测量模式:保留经验结构,定义相关的经验后评估,比较初始和经验后分数,保留轨迹可用性,并报告失败模式。在此套件上表现强大的模型应在Aha-Puzzle中提出更好的问题,在Aha-Euler中以更少的过程辅助重构方法,并在Aha-Vending中维持盈利、弹性的运营。我们的贡献包括:1. 1\.我们形式化了如何在固定参数的语言智能体中衡量推理时经验是否改变后续策略。2. 2\.我们介绍了AhaBench,这是一个包含交互式谜题探索、生成式数学推理和模拟售货操作的三部分套件。3. 3\.我们提供了细粒度分析,表明可见支持、完整过程和最终奖励衡量了不同形式的经验使用。4. 4\.我们用确定性生成器、模拟器代码、评分标准、模型评估接口、脚本基线、不确定性估计和可重现的基准数据实例化了该套件。## 2长期持续学习 AhaBench比较同一个固定参数智能体在相关经验可用前后的表现。设 h 为当前交互状态,D<t\\mathcal\{D\}\_\{<t\} 为先前的课程、反馈或环境轨迹。测量对象是策略偏移 πθ\(a∣h;D<t\) 对比 πθ\(a∣h;∅\),\\pi\_\{\\theta\}\(a\\mid h;\\mathcal\{D\}\_\{<t\}\)\\quad\\text\{versus\\}\\quad\\pi\_\{\\theta\}\(a\\mid h;\\varnothing\),其中参数 θ\\theta 固定。对于初始分数 SinitS\_\{\\mathrm\{init\}\} 和经验后分数 SpostS\_\{\\mathrm\{post\}\},基本迁移估计是增益 = Spost−Sinit。\\mathrm\{gain\\}=S\_\{\\mathrm\{post\\}}\-S\_\{\\mathrm\{init\\}}。我们称这个量为*经验使用增益*。它询问先前交互是否在评估条件改变后改变了后续行为。由于没有单一标量能捕捉这种设置,论文报告了一个小的度量表面。如果 SsupS\_\{\\mathrm\{sup\\}} 是轨迹支持仍然可见时的表现,则*支持依赖差距*为 Ssup−SpostS\_\{\\mathrm\{sup\\}}\-S\_\{\\mathrm\{post\\}};在Aha-Puzzle中,这是有轨迹支持的平均分与最终无提示挑战之间的差距。在Aha-Euler中,类似的*过程依赖差距*是 Sfull−SpartialS\_\{\\mathrm\{full\\}}\-S\_\{\\mathrm\{partial\\}},分离了“答案+代码”教学与仅答案教学。我们还报告*支持增益保留率*,即比例 (Spost−Sinit)/(Ssup−Sinit) (S\_\{\\mathrm\{post\\}}\-S\_\{\\mathrm\{init\\}})/(S\_\{\\mathrm\{sup\\}}\-S\_\{\\mathrm\{init\\}}),只要支持条件有一个自然的分数。这个比例衡量了可见支持增益在支持减少后保留了多少。Aha-Vending使用轨迹而不是单一支持条件,因此并行的诊断是跨天或消息的后期减去早期利润效率斜率。为便于比较,主要评分卡报告初始分数 BB、经验后分数 PP 和学习提升度 Δ=P−B\\Delta=P\-B。初始分数回答“模型从哪里开始?”;经验后分数回答“在评估条件下经验之后它有多强?”;提升度回答“经验之后它的总分改变了多少?”为清晰起见,条件根据评估时可用的支持命名。在Aha-Puzzle中,*最终无提示挑战*是最后一个课程单元,智能体在该单元中为最终谜题接收不到直接的轨迹前缀。在Aha-Euler中,QteachQ\_\{\\mathrm\{teach\\}} 表示教学实例,QtestQ\_\{\\mathrm\{test\\}} 表示结构相关的保留实例。一个图组合任务将 QteachQ\_\{\\mathrm\{teach\\}} 分解为依赖的子计算:*单步*子集有一个节点,而*组合*扫描使用两个到五个节点。在Aha-Vending中,公共评估是一个侧重事件的365天自动售货模拟,包含供应商延迟、退款、钓鱼、机器问题、天气、缺货和破产风险。额外的模拟器变体用作诊断,但主要评分卡报告此事件设置。当完整和部分教学都可用时,我们也使用保留率 = Spartial−SbaseSfull−Sbase,\\mathrm\{retention\\}=\\frac\\{S\_\{\\mathrm\{partial\\}}\-S\_\{\\mathrm\{base\\}}\\}\\{S\_\{\\mathrm\{full\\}}\-S\_\{\\mathrm\{base\\}}\\},作为一个归一化比较。主要证据仍然是直接的部分教学准确性和完整-部分过程差距;保留率有助于比较当代码和解释被保留时,完整教学增益有多少得以保留。AhaBench与普通上下文学习的区别在于评估条件所扮演的角色。在标准的少样本提示中,示例保持可见并可被局部复制。这里,经验后评估是相关但非相同的:一个新的无轨迹前缀的隐藏状态谜题,一个新的 QtestQ\_\{\\mathrm\{test\\}} 输入(其 QteachQ\_\{\\mathrm\{teach\\}} 代码在部分条件下被隐藏),或由先前决策产生的未来模拟器状态。它也不同于参数更新的持续学习:没有重放缓冲区、优化器或梯度更新。问题是部署时的历史是否改变了同一固定智能体的行为。这三个评估操作化了不同形式的迁移。Aha-Puzzle在最终挑战中保留轨迹前缀;Aha-Euler在部分教学中保留解释和代码;Aha-Vending评估决策在后续模拟日中伴随运营事件产生的后果。#### 设计原则。基准设计围绕评估偏移组织。经验后评估与支持信号相关但不相同。示范课程以无帮助评估结束:Aha-Puzzle中的最终无提示挑战和Aha-Euler中的保留 QtestQ\_\{\\mathrm\{test\\}} 实例。教学消融实验改变教师揭示的内容,分离仅答案迁移与答案加代码适应。长期运行保留轨迹,因为许多失败是时间性的:重复无效动作、后期被动或过早停止。发布的运行也包括明确的覆盖范围和评分规则,三个系列作为相关但不同的轴进行报告,而不是折叠成单一任务类型。测量是故意多元化的。Aha-Puzzle分离直接分数、有轨迹支持的分数和最终无提示迁移增益;Aha-Euler分离完整教学准确率和仅答案的部分教学准确率;Aha-Vending分离最终净利润、曲线形状、生存状态和终止模式。## 3基准套件 表1:基准设置和主要信号。共同模式是经验后跟随改变了的评估:无提示谜题探索、保留数学迁移和后续操作控制。表1 (https://arxiv.org/html/2609.05435#S3.T1) 将三个基准系列视为设置而非排行榜。每个系列使不同种类的经验可观察。Aha-Puzzle关于在隐藏状态下的探索:智能体必须在新的交互环境中决定问哪些问题。Aha-Euler关于数学推理:智能体必须从一个相关的教学实例中推断或重构一个计算。Aha-Vending关于操作规划:智能体必须利用模拟业务的延迟后果来赚钱,而不至于在任务周期后期崩溃。#### 数据来源与新构建。数据策略是有意混合的。Aha-Puzzle来源于并经过经典横向思维情境谜题的策展:简短的是否/隐藏故事谜题,包括经典的信天翁谜题(解答者必须通过问题揭示未说明的解释)[45 (https://arxiv.org/html/2609.05435#bib.bib29), 56 (https://arxiv.org/html/2609.05435#bib.bib30)]。人类标注者在发布前验证了细粒度的隐藏解决方案、允许的主持人回答、评分标准和最佳轨迹摘要。Aha-Euler遵循 VeRA 中数学推理的可执行规范观点,将静态数学问题转化为具有自动验证的可执行规范 [8 (https://arxiv.org/html/2609.05435#bib.bib54)],并使用 Project Euler 作为数学编程思路的源领域 [37 (https://arxiv.org/html/2609.05435#bib.bib31)]。基准实例由我们新实现:我们将每个问题族转化为具有大输入空间的可执行生成器,创建带有精确验证器的配对教学和保留实例,并在依赖图中连接子计算以控制组合难度。Aha-Vending受 Vending-Bench 系列 [3 (https://arxiv.org/html/2609.05435#bib.bib2), 1 (https://arxiv.org/html/2609.05435#bib.bib32)] 启发;它贡献了一个开源模拟器、事件设置、脚本基线、轨迹摘要和评估接口。简而言之,Aha-Puzzle经过人工策展和验证,Aha-Euler受 Project Euler 启发但新生成,Aha-Vending由我们的模拟器生成。#### Aha-Puzzle。每个来源的情境谜题都隐藏一个解释链。智能体提出是/否或简答题,然后给出最终解释,根据正确性和效率评分。课程揭示进展。
相似文章
PAST-Bench:对个人智能体中递归自我改进基础的基准测试
介绍了 PAST-Bench,一个用于评估个人 AI 智能体是否能够通过跨会话保留的经验得到改进的基准,以及 Hermes+,一个带有针对性干预措施的扩展。发现改进是真实的,但在不同能力和模型之间并不均衡。
@omarsar0: // Continual Learning Bench // 持续学习是投入大量资金的研究领域之一。虽然存在…
CL-Bench 是一个经过专家验证的跨六个领域的新基准,用于评估基于LLM的智能体是否真正从序列经验中学习。它发现,朴素上下文学习往往优于专用的记忆系统,表明当前架构增加了开销而非真正的学习。
EvoClawBench:智能体能否从自身运行中学习可复用技能?
本文介绍了EvoClawBench,一个旨在测试AI智能体能否从自身执行运行中学习可复用技能的基准测试。多个智能体运行时的实验表明,技能学习具有选择性和成本敏感性,并非自动受益。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
AgentHPOBench:评估LLM智能体作为顺序超参数优化器的基准
介绍了AgentHPOBench,这是一个顺序基准,用于在30个机器学习任务中评估LLM智能体作为超参数优化器的表现,结果显示当前智能体具有可测量的但有限的迭代优化能力。