通过智能体轨迹剖析模型行为

arXiv cs.AI 论文

摘要

本文介绍了Simple Strands Agent (SSA),这是一个最小化的框架,旨在缩小AI模型与其智能体行为之间的意图-执行差距,并通过分析各类模型家族的138k条轨迹,揭示细粒度的行为差异。

arXiv:2606.17454v1 公告类型:新发布 摘要:AI智能体的性能不仅仅是建模问题,从根本上说是一个系统问题。模型的高级能力是通过智能体框架实现的。因此,模型假设与框架行为之间的差距很容易阻碍模型的全部能力转化为智能体性能。我们将其形式化为"意图-执行"差距:模型意图与框架执行之间的不匹配,反之亦然。我们认为,最小化这种意图-执行差距与框架设计的其他方面(如工具和执行循环)同样重要。为了说明这种框架-模型对齐的影响,我们开发了一个简单且可定制的框架,称为"Simple Strands Agent" (SSA)。SSA旨在寻找能够跨不同模型家族(如Claude、Gemini、GPT、Grok、Qwen)泛化的常见模式的主体部分,以及少量模型特定的偏好。我们做出两项贡献:(i) 我们在流行的智能体基准测试(SWE-Pro、SWE-Verified和Terminal-Bench-2)上,\textbf{复现或改进了}各模型供应商家族报告的pass@1性能;(ii) 基于对SSA生成的\textbf{138k条轨迹的分析},我们超越了通常在前沿模型之间相对均匀的$\texttt{pass@1}$数字。通过将智能体轨迹表示为代码状态空间,我们观察到问题解决行为中的模型级差异。更细粒度的指标,如编辑频率、测试活动和阶段转换,揭示了单个模型如何在自主解决问题的不同阶段分配精力。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:36

# 通过智能体轨迹剖析模型行为
来源:https://arxiv.org/abs/2606.17454
查看 PDF(https://arxiv.org/pdf/2606.17454)

> **摘要**:AI 智能体的性能不仅仅是一个建模问题,它本质上是一个系统问题。模型的先进能力是通过智能体框架(agent harness)实现的。因此,模型假设与框架行为之间的差距很容易阻碍模型将其全部能力转化为智能体性能。我们将此形式化为“意图-执行”差距:模型意图与框架执行之间的不匹配,反之亦然。我们认为,最小化这一意图-执行差距与框架设计的其他方面(如工具和执行循环)同等重要。为了说明这种框架-模型对齐的影响,我们开发了一个简单且可定制的框架,称为“Simple Strands Agent”(SSA)。SSA 旨在找到跨越不同模型系列(如 Claude、Gemini、GPT、Grok、Qwen)的常见模式主体,以及少量模型特定的偏好。我们做出两项贡献:(i)我们在流行的智能体基准测试(SWE-Pro、SWE-Verified 和 Terminal-Bench-2)上 **复现或改进了各个模型供应商系列报告 pass@1 性能**;(ii)基于对 **SSA 生成的 138k 条轨迹的分析**,我们超越了各前沿模型之间往往相对均匀的 `pass@1` 数值。通过将智能体轨迹表示为代码状态空间,我们观察到模型级别在问题求解行为上的差异。更细粒度的指标,如编辑频率、测试活动以及阶段转换,揭示了单个模型如何在自主问题求解的不同阶段分配工作。

## 提交历史

来自:Gaurav Gupta [查看电子邮件 (https://arxiv.org/show-email/cff9f92a/2606.17454)]  
**[v1]** 2026 年 6 月 16 日,星期二,03:17:03 UTC(1,889 KB)

相似文章

StraTA:通过策略轨迹抽象激励智能体强化学习

Hugging Face Daily Papers

StraTA 提出了面向长期任务 LLM 智能体的策略轨迹抽象方法,通过分层 GRPO 风格的 rollout、多样化策略采样和批判性自判断机制,在样本效率和最终性能上超越了前沿模型和先前 RL 基线。