FocusMem:潜在GUI记忆中的内容、读出与信任分解

Hugging Face Daily Papers 论文

摘要

FocusMem为GUI智能体引入了一种潜在记忆接口,将内容保留、状态条件读出和信任门控分离,以提高记忆可靠性。在五个GUI智能体基准测试中,它始终优于固定记忆基线。

GUI智能体必须记住来自早期任务的有用经验以及当前交互中未完成的进度。潜在记忆通过将多模态轨迹压缩为少量连续令牌提供了一种紧凑的解决方案。然而,现有方法通常将每条轨迹映射到一个固定的记忆块,并主要通过下一步动作监督进行训练。这产生了三个实际问题:压缩过程中可能会丢失重要细节,同一记忆块必须服务于不同的决策阶段,以及不相关的检索轨迹仍可能误导智能体。我们引入了FocusMem,在紧凑的潜在记忆接口中分离这些职责。角色感知的内容基础促使情景记忆保留可复用的经验,工作记忆保留任务进度。状态条件读出为相同的存储证据生成特定于决策的视图,而轻量级信任门控可以抑制看起来与当前步骤无关的记忆块。所有组件都在GUI策略保持冻结的情况下进行训练。在五个GUI智能体基准测试中,FocusMem持续优于完全匹配的仅动作固定记忆基线和先前的潜在记忆改编。进一步分析表明,语义和功能监督保留了互补信息,状态条件读出随着周围轨迹上下文的增长而更加鲁棒,信任门控减少了注入不相关情景证据所造成的损害。这些结果表明,有效的潜在记忆不仅依赖于压缩过去的交互,还依赖于保留什么、暴露什么以及允许什么。
查看原文
查看缓存全文

缓存时间: 2026/08/06 09:50

论文页面 - FocusMem:在潜在 GUI 记忆中分解内容、读出与信任

来源:https://huggingface.co/papers/2608.04530

摘要

GUI 智能体必须同时记住早期任务中的有用经验和当前交互中未完成的进度。潜在记忆通过将多模态轨迹压缩为少数连续 token 提供了一种紧凑的解决方案。然而,现有方法通常将每条轨迹映射到一个固定的记忆块,并主要通过下一动作监督来训练它。这带来了三个实际问题:压缩过程中可能丢失重要细节;同一个记忆块必须服务于不同的决策阶段;检索到的不相关轨迹仍可能误导智能体。我们引入了 FocusMem,它在紧凑的潜在记忆接口内分离了这些职责。角色感知的内容基底鼓励情景记忆保留可复用经验,并鼓励工作记忆保留任务进度。状态条件读出为同一存储证据生成决策特定的视图,而轻量级信任门控可以抑制看似与当前步骤无关的记忆块。所有组件都在 GUI 策略保持冻结的情况下进行训练。在五个 GUI 智能体基准上,FocusMem 始终优于完全匹配的仅动作固定记忆基线以及先前的潜在记忆适配方法。进一步分析表明,语义和功能监督保留了互补信息;随着周围轨迹上下文的增长,状态条件读出更加稳健;信任门控减少了注入不相关情景证据所造成的损害。这些结果表明,有效的潜在记忆不仅取决于压缩过去的交互,还取决于保留什么、暴露什么以及允许什么。

查看 arXiv 页面 (https://arxiv.org/abs/2608.04530) 查看 PDF (https://arxiv.org/pdf/2608.04530) GitHub0 (https://github.com/stanley-ju/FocusMem) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04530)

引用本文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.04530 即可从本页面链接到该模型。

引用本文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.04530 即可从本页面链接到该数据集。

引用本文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.04530 即可从本页面链接到该 Space。

包含本文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接到它。

相似文章

GateMem:多主体共享记忆代理中的记忆治理基准评测

Hugging Face Daily Papers

GateMem是一个用于评估多主体共享记忆代理中记忆治理的基准,涵盖医疗、办公、教育和家庭领域的效用、访问控制和遗忘。当前方法无法同时平衡这三者,表明可靠的共享机构部署仍然难以实现。