AgentLens: 面向编码智能体评估的生产评估轨迹审查
摘要
AgentLens 是一个新的开源基准测试,用于评估编码智能体,它评估交互的完整轨迹,包括指令遵循、工具使用、错误恢复等,使用形式化验证和LLM编写的审查。
arXiv:2607.06624v1 Announce Type: new
Abstract: 我们提出 AgentLens,一个面向交互式代码智能体的生产评估基准测试。大多数代码智能体基准测试将一次运行简化为单个比特——任务是否通过?——但实际使用这些智能体的人体验的是整个轨迹:智能体如何遵循指令、使用工具、验证自身工作、从错误中恢复以及沿途与用户对话。AgentLens 评估整个轨迹。它将存在客观检查的形式化验证与LLM编写的轨迹审查及并排比较相结合,使得每次运行都能产生关于得分原因的易读解释。这使得 AgentLens 的用途不仅限于模型排名:我们用它来诊断模型行为、比较我们自己智能体的连续版本,并在夜间评估管线中捕获产品回归。我们以开源形式发布该基准测试,地址为 https://github.com/agent-lens/agent-lens-bench。
查看缓存全文
缓存时间: 2026/07/09 07:54
# AgentLens:面向编码智能体评估的生产环境评估轨迹审查 来源:https://arxiv.org/abs/2607.06624 查看 PDF (https://arxiv.org/pdf/2607.06624) > 摘要:我们提出 AgentLens,一个面向交互式代码智能体的生产环境评估基准。大多数代码智能体基准测试将一次运行简化为一个单一比特——任务是否通过?——但实际使用这些智能体的人体验的是整个轨迹:智能体如何遵循指令、使用工具、验证自身工作、从错误中恢复,以及在此过程中如何与用户沟通。AgentLens 评估的就是这整个轨迹。它将形式化验证(存在客观检查项)与 LLM 编写的轨迹审查及并排对比相结合,使得每次运行都能生成易读的解释,说明得分为何如此。这使得 AgentLens 不仅仅用于模型排名:我们还用它来诊断模型行为、比较我们自身智能体的连续版本,并在夜间评估流水线中捕获产品回归。我们将该基准以开源形式发布于此 https URL (https://github.com/agent-lens/agent-lens-bench)。 ## 提交历史 来自:Vadim Lomshakov \[查看邮件 (https://arxiv.org/show-email/71ed48c2/2607.06624)\] **\[v1\]**2026年7月7日星期二 11:27:43 UTC (263 KB)
相似文章
AgentLens: 揭示 SWE-Agent 评估中的 Lucky Pass 问题
AgentLens 是一个用于软件工程智能体轨迹过程级评估的框架,揭示了超过 10% 的通过轨迹表现出 'Lucky Pass' 行为。它引入了 AgentLens-Bench,一个带有质量评分标注的数据集,并表明按质量评分排序可以显著改变模型排名。
AgentCompass: 统一智能体能力评估基础设施
AgentCompass 是一个面向基于大语言模型的智能体的开源、轻量级且可扩展的评估基础设施,将基准测试、测试框架与运行环境解耦,支持灵活配置。它覆盖五个能力维度共20多个基准测试,并提供容错运行时与轨迹分析工具。
ClinLens:面向纵向多模态临床数据科学的长期编码智能体
ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。
REAP: 从交互式生产使用中自动策划编码代理基准 [R]
REAP是一个自动化管道,从真实的开发者-代理会话中策划生产环境衍生的编码代理基准,利用基于LLM的分类和稳定性检查,确保无需手动标注的可靠评估。
移动智能体评估中的 LLM 评判器基准测试
本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。