TRACE: 面向高效GUI代理的轨迹稳健准入与证据排序
摘要
TRACE是一个免训练框架,通过基于效用和多样性对视觉证据进行排序来优化GUI代理效率,利用自适应令牌管理和KV收缩减少延迟和内存使用。
查看缓存全文
缓存时间: 2026/09/14 14:35
论文页面 - TRACE:面向高效GUI智能体的轨迹鲁棒准入与证据排序框架
来源:https://huggingface.co/papers/2609.10297
摘要
TRACE 是一个无需训练的框架,它通过未来效用和多样性对视觉证据进行排序,为覆盖空间范围预留原生视觉标记,并通过收缩退役帧来降低 GUI 智能体的延迟和内存占用。
GUI 智能体(https://huggingface.co/papers?q=GUI%20agents)在交互过程中会积累高分辨率截图,导致推理延迟和内存使用增加。无需训练的视觉标记剪枝(https://huggingface.co/papers?q=visual%20token%20pruning)可以降低这种开销,但缓存重用机制引入了一个根本性限制:一旦标记被丢弃,对应的视觉证据就无法在不重新编码的情况下恢复。因此,剪枝成为一个不可逆的准入决策,它必须在有限的预算下,既保持对可操作区域的覆盖,又对未来未知的目标保持有效性。为应对这些挑战,我们提出了 TRACE,一个用于**轨迹鲁棒准入(Trajectory-robust Admission)与覆盖感知证据排序(Coverage-aware Evidence ordering)**的无需训练框架。具体而言,我们结合了一种与查询无关的、源自布局的交互先验(interaction prior)、指令相关性和特征新颖性,根据潜在未来效用和多样性对视觉证据进行排序。接着,我们将部分预算预留给屏幕内部分布的原生视觉标记,在不破坏排序的前提下修复缺失的空间覆盖。这些机制共同生成了一种嵌套标记顺序(nested token order),使得保留的视觉证据能在不同预算下单调收缩,同时在整个轨迹中保持可重用性。最后,我们的单调KV收缩(monotoneKV contraction)机制将退役帧逐步压缩为紧凑的会话状态,避免了重复的视觉编码或剪枝。在六个 GUI 基准测试和多种模型上的大量实验,验证了我们所提框架在有限预算下的有效性。源代码将会发布。
查看 arXiv 页面 (https://arxiv.org/abs/2609.10297)查看 PDF (https://arxiv.org/pdf/2609.10297)GitHub (https://github.com/924973292/TRACE)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.10297)
在您的智能体中获取此论文:
hf papers read 2609\.10297
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.10297 以从本页链接。
引用此论文的数据集 0
没有数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.10297 以从本页链接。
引用此论文的 Spaces 0
没有 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.10297 以从本页链接。
包含此论文的收藏夹 0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
从策略错误中恢复:鲁棒GUI代理的基准测试与轨迹合成
引入GUI-RobustEval(一个用于GUI代理错误恢复的基准)和鲁棒性驱动轨迹合成(RoTS)以生成训练数据,在OSWorld上达到当前最佳性能。
TRACE:面向长周期智能体安全的轨迹风险感知压缩方法
本文提出 TRACE,一种面向长周期 LLM 智能体的轨迹级安全检测方法,通过将完整轨迹证据压缩为潜在状态,更好地聚合分散的风险信号,在多个基准上达到最先进的准确率。
高效GUI代理:观察、记忆、动作与运行时优化的系统调研
本调研通过系统视角审视高效GUI代理,重点关注观察、记忆、动作和运行时优化,并识别关键重复出现的概念,如选择性阅读和混合运行时。
与您协同进步:将用户修正编译为编码代理的运行时强制
TRACE 是一个技能层管道,通过从交互式编码代理中挖掘用户修正,编译为运行时检查,在减少重复偏好违反方面显著优于仅靠记忆,这一点在 ClawArena 和 MemoryArena 任务中得到验证。