TraceDance:一个从真实世界代理部署轨迹构建代理行为基准的自动化系统

Hugging Face Daily Papers 论文

摘要

TraceDance是一个自动化系统,它从真实世界的代理部署轨迹中构建针对性基准,以评估大语言模型(LLMs)中的不良行为,实现了高构建率并揭示了当前前沿模型的显著弱点。

一个代理可以在执行过程中表现出不良行为的同时完成任务。开发者需要针对部署中遇到的特定行为进行测试,而不仅仅是固定的基准套件。我们介绍了TraceDance,一个代理系统,它从部署轨迹中为用户指定的不良行为构建针对性基准。为了高效构建,Anchor-and-Confirm结合了可编程检索与由Flash大语言模型(LLM)进行的候选级确认,而Anchor Synthesis Loop生成并修订自定义行为的规范。基准使用决策点延续来评估LLM在记录的决策点上的下一轮响应,使用特定行为的评分标准,无需参考答案或环境重放。在编码和通用工具使用方面的实验基于252,557个会话,产生了107个基准和4,125个实例,满足了95.3%的构建目标请求。人类标注者在84%的采样实例中确认了请求的行为,而自动评分器与人类通过/失败判断的一致性与标注者之间的一致性相当。九个前沿LLMs的平均通过率仅为26.7%,表明它们在评估的决策点上仍难以做出适当响应。跨特定行为基准的分析进一步揭示了当前LLMs作为代理行为时的弱点。通过将部署问题转化为针对性基准,TraceDance可以作为递归自我改进(RSI)循环的关键组成部分。
查看原文
查看缓存全文

缓存时间: 2026/09/29 04:11

论文页 - TraceDance:基于真实智能体部署轨迹构建行为基准的自动化系统

来源:https://huggingface.co/papers/2609.33295
发布于 9 月 27 日

#1 当日最佳论文 (https://huggingface.co/papers/date/2026-09-29)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,

摘要

智能体在完成任务时可能表现出不良行为。开发者需要针对部署中遇到的特定行为进行测试,而不仅仅依赖固定的基准测试套件。我们提出 TraceDance,这是一种智能体系统,可根据用户指定的不良行为,从部署轨迹中构建针对性基准。为实现高效构建,Anchor-and-Confirm 结合了可编程检索与由 Flash 大语言模型(LLM)执行的候选级别确认,而 AnchorSynthesisLoop 则针对自定义行为生成并修订规范。基准测试使用决策点延续评估 LLM 在记录决策点处的下一步响应,采用行为特定的评分标准,无需参考答案或环境回放。在编码和通用工具使用方面的实验基于 252,557 个会话,生成了包含 4,125 个实例的 107 个基准,满足了 95.3% 的构建目标请求。人类标注员在 84% 的抽样实例中确认了所请求的行为,而自动评分器与人类通过/失败判断的一致性与标注员之间的一致性相当。九个前沿 LLM 的平均通过率仅为 26.7%,表明它们在评估的决策点上仍难以做出恰当响应。对行为特定基准的进一步分析揭示了当前 LLM 作为智能体行为时的弱点。通过将部署问题转化为针对性基准,TraceDance 可成为递归自我改进(RSI)循环中的关键组件。

查看 arXiv 页面 (https://arxiv.org/abs/2609.33295) 查看 PDF (https://arxiv.org/pdf/2609.33295) 项目页面 (https://zhishanq.github.io/TraceDance/) GitHub (https://github.com/ZhishanQ/TraceDance) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.33295)

在智能体中获取本文:

hf papers read 2609\.33295

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.33295 以从本页面链接。

引用本文的数据集 0

无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.33295 以从本页面链接。

引用本文的 Space 0

无 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2609.33295 以从本页面链接。

包含本文的收藏夹 0

无收藏夹包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

BenchTrace:用于测试LLM智能体反思能力与受控演进的基准

arXiv cs.AI

BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。

TRACE Bench:任务驱动的角色扮演智能体清单评估

arXiv cs.CL

TRACE Bench 是一个任务驱动的角色扮演智能体清单评估框架,它将角色设定分解为清单,使用用户智能体进行自然对话,并将得分追溯到清单项目和对话证据。其覆盖率高达 99.91%,优于 MiniMax Role-play Benchmark 的 73.74%,并支持跨越 26 个模型的闭环基准演进。