AgentLens: 揭示 SWE-Agent 评估中的 Lucky Pass 问题
摘要
AgentLens 是一个用于软件工程智能体轨迹过程级评估的框架,揭示了超过 10% 的通过轨迹表现出 'Lucky Pass' 行为。它引入了 AgentLens-Bench,一个带有质量评分标注的数据集,并表明按质量评分排序可以显著改变模型排名。
查看缓存全文
缓存时间: 2026/05/14 04:16
论文页面 - AgentLens: 揭示SWE智能体评估中的“幸运通过“问题
来源: https://huggingface.co/papers/2605.12925
摘要
软件工程智能体通过一个过程级框架进行评估,该框架揭示了有效方法与无效方法之间的差异,识别出诸如“幸运通过“等模式,并为改进评估提供质量评分。
软件工程(SWE)智能体的评估主要依赖一个二元信号:最终补丁是否通过测试。这种仅关注结果的视角将原理性解决方案与混乱的试错过程视为等同。我们证明这种等同性在经验上是错误的。我们评估了来自八个模型后端的2,614条OpenHands轨迹,这些轨迹针对60个SWE-bench验证任务(https://huggingface.co/papers?q=SWE-bench%20Verified%20tasks)。其中,47个任务拥有足够多的通过轨迹以构建任务级过程参考,形成包含1,815条轨迹的评估(https://huggingface.co/papers?q=trajectory%20evaluation)子集。在该子集的通过轨迹中,10.7%表现出我们称之为“幸运通过“(Lucky Pass)的行为:回归循环、盲目重试、缺少验证(https://huggingface.co/papers?q=verification),或探索(https://huggingface.co/papers?q=exploration)、实现(https://huggingface.co/papers?q=implementation)和验证(https://huggingface.co/papers?q=verification)在时间上无序。我们引入了AgentLens(https://huggingface.co/papers?q=AgentLens),一个用于SWE智能体轨迹过程级评估的框架,并发布了AgentLens-Bench(https://huggingface.co/papers?q=AgentLens-Bench)数据集,其中包含1,815条带有质量分数(https://huggingface.co/papers?q=quality%20scores)、浪费信号(https://huggingface.co/papers?q=waste%20signals)、分歧点(https://huggingface.co/papers?q=divergence%20points)以及47个任务级前缀树接收器(PTA)(https://huggingface.co/papers?q=Prefix%20Tree%20Acceptor%20(PTA))参考的轨迹。AgentLens(https://huggingface.co/papers?q=AgentLens)通过合并同一任务的多个通过解决方案来构建PTA参考,并使用一个上下文敏感意图标注器(https://huggingface.co/papers?q=context-sensitive%20intent%20labeler),根据轨迹历史(而非仅工具身份)将动作分配给探索(https://huggingface.co/papers?q=Exploration)、实现(https://huggingface.co/papers?q=Implementation)、验证(https://huggingface.co/papers?q=Verification)或编排(https://huggingface.co/papers?q=Orchestration)。在AgentLens-Bench(https://huggingface.co/papers?q=AgentLens-Bench)上,质量分数将通过的轨迹划分为幸运(Lucky)、稳健(Solid)和理想(Ideal)等级,并进一步将“幸运通过“分解为五种常见机制。在八个模型后端中,“幸运“率(Lucky rates)从0.5%到23.2%不等,一些模型按质量分数排序时相比按通过率排序移动了多达五个排名位置。我们在https://github.com/microsoft/code-agent-state-trajectories/ 发布了匿名化项目仓库,包括AgentLens-Bench(https://huggingface.co/papers?q=AgentLens-Bench)数据集和AgentLens(https://huggingface.co/papers?q=AgentLens)SDK。
查看arXiv页面 (https://arxiv.org/abs/2605.12925) 查看PDF (https://arxiv.org/pdf/2605.12925) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12925)
在您的智能体中获取此论文:
hf papers read 2605\.12925
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2605.12925 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2605.12925 以从此页面链接。
引用此论文的Space0
没有Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2605.12925 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
AgentLens: 面向编码智能体评估的生产评估轨迹审查
AgentLens 是一个新的开源基准测试,用于评估编码智能体,它评估交互的完整轨迹,包括指令遵循、工具使用、错误恢复等,使用形式化验证和LLM编写的审查。
评估使用工具的LLM代理中的漏洞利用(4分钟阅读)
Cursor的一项审计发现,SWE-bench Pro上63%的成功LLM代理运行是通过检索修复而非推导修复,凸显了编码基准测试中普遍存在的奖励黑客行为。该研究提出了更严格的环境控制来缓解这种行为。
AgentCompass: 统一智能体能力评估基础设施
AgentCompass 是一个面向基于大语言模型的智能体的开源、轻量级且可扩展的评估基础设施,将基准测试、测试框架与运行环境解耦,支持灵活配置。它覆盖五个能力维度共20多个基准测试,并提供容错运行时与轨迹分析工具。
智能体自驱动显微镜基准测试支持资格认证,但未必能泛化到未见任务
本文介绍了一个基准测试与轨迹记录框架,用于评估控制显微镜的基于LLM的智能体,比较了105种智能体配置,发现基准测试有助于资格验证,但无法可靠预测智能体在未见任务上的表现。
@omarsar0: // 代理并非单独失败 // 一款非常棒的开源评估工具,用于检查代理的可靠性。里面有很多酷点子。…
本文介绍了ProofAgent-Harness,这是一款开源评估工具,从七个标准衡量AI代理的上下文工程质量,并将其验证为代理可靠性的领先指标。