FocusMem:潜在GUI记忆中的内容、读出与信任分解
摘要
FocusMem为GUI智能体引入了一种潜在记忆接口,将内容保留、状态条件读出和信任门控分离,以提高记忆可靠性。在五个GUI智能体基准测试中,它始终优于固定记忆基线。
查看缓存全文
缓存时间: 2026/08/06 09:50
论文页面 - FocusMem:在潜在 GUI 记忆中分解内容、读出与信任
来源:https://huggingface.co/papers/2608.04530
摘要
GUI 智能体必须同时记住早期任务中的有用经验和当前交互中未完成的进度。潜在记忆通过将多模态轨迹压缩为少数连续 token 提供了一种紧凑的解决方案。然而,现有方法通常将每条轨迹映射到一个固定的记忆块,并主要通过下一动作监督来训练它。这带来了三个实际问题:压缩过程中可能丢失重要细节;同一个记忆块必须服务于不同的决策阶段;检索到的不相关轨迹仍可能误导智能体。我们引入了 FocusMem,它在紧凑的潜在记忆接口内分离了这些职责。角色感知的内容基底鼓励情景记忆保留可复用经验,并鼓励工作记忆保留任务进度。状态条件读出为同一存储证据生成决策特定的视图,而轻量级信任门控可以抑制看似与当前步骤无关的记忆块。所有组件都在 GUI 策略保持冻结的情况下进行训练。在五个 GUI 智能体基准上,FocusMem 始终优于完全匹配的仅动作固定记忆基线以及先前的潜在记忆适配方法。进一步分析表明,语义和功能监督保留了互补信息;随着周围轨迹上下文的增长,状态条件读出更加稳健;信任门控减少了注入不相关情景证据所造成的损害。这些结果表明,有效的潜在记忆不仅取决于压缩过去的交互,还取决于保留什么、暴露什么以及允许什么。
查看 arXiv 页面 (https://arxiv.org/abs/2608.04530) 查看 PDF (https://arxiv.org/pdf/2608.04530) GitHub0 (https://github.com/stanley-ju/FocusMem) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04530)
引用本文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.04530 即可从本页面链接到该模型。
引用本文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.04530 即可从本页面链接到该数据集。
引用本文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.04530 即可从本页面链接到该 Space。
包含本文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接到它。
相似文章
MementoGUI:学习智能体多模态记忆控制以支持长时域GUI代理
MementoGUI 提出了一种用于 GUI 代理的插件式智能体记忆框架,该框架使用学习到的控制器进行选择性记忆管理与检索,通过压缩的视觉与文本表示提升了长期任务的性能。
MemGUI-Agent:一种具有主动上下文管理的端到端长周期移动GUI智能体
MemGUI-Agent 引入了针对长周期移动GUI任务的主动上下文管理,利用上下文即动作(ConAct)来维护关键信息。它包含 MemGUI-3K 数据集,并使用一个 80 亿参数的模型在 MemGUI-Bench 和 MobileWorld 基准测试上达到了最先进的性能。
GateMem:多主体共享记忆代理中的记忆治理基准评测
GateMem是一个用于评估多主体共享记忆代理中记忆治理的基准,涵盖医疗、办公、教育和家庭领域的效用、访问控制和遗忘。当前方法无法同时平衡这三者,表明可靠的共享机构部署仍然难以实现。
MemForest:一种具有分层时间索引的高效智能体记忆系统
MemForest 提出了一种面向长上下文 LLM 智能体的记忆框架,通过并行块提取和分层时间索引来提高可扩展性并降低延迟,在基准测试中实现了 6 倍的吞吐量提升。
TRACE: 面向LLM代理的开源层次化记忆系统,在MemoryAgentBench的EventQA任务中使用gpt-oss-20B达到82.5% [P]
TRACE是一个面向LLM代理的开源层次化记忆系统,它将对话历史组织成主题树,使用开放权重模型在MemoryAgentBench的EventQA任务上达到了82.5%的F1分数,性能优于Mem0和MemGPT。