TraceDance:一个从真实世界代理部署轨迹构建代理行为基准的自动化系统
摘要
TraceDance是一个自动化系统,它从真实世界的代理部署轨迹中构建针对性基准,以评估大语言模型(LLMs)中的不良行为,实现了高构建率并揭示了当前前沿模型的显著弱点。
查看缓存全文
缓存时间: 2026/09/29 04:11
论文页 - TraceDance:基于真实智能体部署轨迹构建行为基准的自动化系统
来源:https://huggingface.co/papers/2609.33295
发布于 9 月 27 日
#1 当日最佳论文 (https://huggingface.co/papers/date/2026-09-29)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
智能体在完成任务时可能表现出不良行为。开发者需要针对部署中遇到的特定行为进行测试,而不仅仅依赖固定的基准测试套件。我们提出 TraceDance,这是一种智能体系统,可根据用户指定的不良行为,从部署轨迹中构建针对性基准。为实现高效构建,Anchor-and-Confirm 结合了可编程检索与由 Flash 大语言模型(LLM)执行的候选级别确认,而 AnchorSynthesisLoop 则针对自定义行为生成并修订规范。基准测试使用决策点延续评估 LLM 在记录决策点处的下一步响应,采用行为特定的评分标准,无需参考答案或环境回放。在编码和通用工具使用方面的实验基于 252,557 个会话,生成了包含 4,125 个实例的 107 个基准,满足了 95.3% 的构建目标请求。人类标注员在 84% 的抽样实例中确认了所请求的行为,而自动评分器与人类通过/失败判断的一致性与标注员之间的一致性相当。九个前沿 LLM 的平均通过率仅为 26.7%,表明它们在评估的决策点上仍难以做出恰当响应。对行为特定基准的进一步分析揭示了当前 LLM 作为智能体行为时的弱点。通过将部署问题转化为针对性基准,TraceDance 可成为递归自我改进(RSI)循环中的关键组件。
查看 arXiv 页面 (https://arxiv.org/abs/2609.33295) 查看 PDF (https://arxiv.org/pdf/2609.33295) 项目页面 (https://zhishanq.github.io/TraceDance/) GitHub (https://github.com/ZhishanQ/TraceDance) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.33295)
在智能体中获取本文:
hf papers read 2609\.33295
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.33295 以从本页面链接。
引用本文的数据集 0
无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.33295 以从本页面链接。
引用本文的 Space 0
无 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2609.33295 以从本页面链接。
包含本文的收藏夹 0
无收藏夹包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
TraceGraph:用于诊断和改进智能体轨迹的共享决策景观
TraceGraph是一个基于图的框架,它从多模型智能体轨迹中构建共享决策景观,从而能够诊断故障区域并通过陷阱感知恢复流水线进行改进。
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
SkillTrace:面向LLM智能体技能复用的多迹溯源审计
提出了SkillTrace,一种面向LLM智能体技能复用的多迹溯源审计框架,该框架提取表达迹、实现迹和操作迹,在基准测试上取得了较高的准确率,并能够进行大规模真实环境审计。
BenchTrace:用于测试LLM智能体反思能力与受控演进的基准
BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。
TRACE Bench:任务驱动的角色扮演智能体清单评估
TRACE Bench 是一个任务驱动的角色扮演智能体清单评估框架,它将角色设定分解为清单,使用用户智能体进行自然对话,并将得分追溯到清单项目和对话证据。其覆盖率高达 99.91%,优于 MiniMax Role-play Benchmark 的 73.74%,并支持跨越 26 个模型的闭环基准演进。