下一张截图见分晓:移动GUI智能体的门控后见蒸馏
摘要
提出了门控后见蒸馏(GHD)方法,利用未来截图作为训练期间的特权信息,恢复移动GUI智能体的正确推理,在AndroidWorld和AndroidLab上两个视觉语言模型中提升了任务成功率。
查看缓存全文
缓存时间: 2026/08/12 08:21
论文页面 - 下一张截图知道答案:面向移动GUI智能体的门控后见之明蒸馏
来源:https://huggingface.co/papers/2608.06065
摘要
门控后见之明蒸馏(Gated Hindsight Distillation)通过利用未来截图作为特权证据,在标准模仿学习失败时恢复正确的推理,从而改进GUI智能体的训练。
GUI智能体通常从成功的交互轨迹中进行离线训练。标准训练将每条轨迹分解为前缀-动作对:智能体根据当前屏幕和交互历史预测一个动作,而随后的观察结果则被丢弃。这就丢失了动作之所以正确的依据:证据往往只出现在后续屏幕上。例如,要启用Soft Wrap,智能体应点击Edit或View,但在菜单打开之前,没有任何信息能揭示这一点。没有这样的证据,标准模仿学习几乎不给模型采样并因此学习正确推理的机会。为了解决这个问题,我们提出了门控后见之明蒸馏(Gated Hindsight Distillation,https://huggingface.co/papers?q=Gated%20Hindsight%20Distillation)(GHD),在训练期间将下一张截图作为特权信息(https://huggingface.co/papers?q=privileged%20information)使用。学生模型从可观察的轨迹前缀进行预测,而参数共享的教师模型(https://huggingface.co/papers?q=parameter-sharing%20teacher)则额外观察下一张截图,并对学生模型的自采样响应(https://huggingface.co/papers?q=on-policy%20responses)重新评分。我们仅在学生模型失败且后见之明条件下的教师模型恢复了演示动作时应用蒸馏。在AndroidWorld和AndroidLab上,GHD在两种视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)上的任务成功率均优于GRPO(https://huggingface.co/papers?q=GRPO)。代码和检查点将很快公开。
查看arXiv页面(https://arxiv.org/abs/2608.06065)查看PDF(https://arxiv.org/pdf/2608.06065)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.06065)
让您的智能体获取这篇论文:
hf papers read 2608\.06065
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.06065即可从本页链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.06065即可从本页链接到它。
引用此论文的Space 0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.06065即可从本页链接到它。
收录此论文的集合 0
没有包含此论文的集合
将此论文添加到集合(https://huggingface.co/new-collection)中即可从本页链接到它。
相似文章
面向GUI代理的技能引导连续蒸馏
该论文提出了技能引导连续蒸馏(SGCD),这是一个迭代式自我改进框架,利用技能引导策略在闭环执行过程中为偏离轨迹的状态生成监督信号,将OSWorld-Verified上GUI代理的成功率从约30%提升至超过50%。
MIRAGE:具备隐式推理与生成式世界模型的移动智能体
MIRAGE 是一个面向移动端 GUI 智能体的框架,它以紧凑的连续潜在表示取代冗长的思维链推理,并融入生成式世界模型视角,在执行操作前预测未来的屏幕状态。在 AndroidWorld 和 AndroidControl 基准测试中,该框架在减少超过 75% 生成 token 的同时,实现了具有竞争力或更优的性能表现。
Teach-and-Repeat: 从移动屏幕演示中准确提取操作知识以赋能GUI代理
介绍了Teach VLM,一种从移动屏幕演示中提取逐步操作知识的模型,以及Teach-and-Repeat范式,该范式利用这些知识指导GUI代理,在新基准上实现了最先进的性能。
HINT-SD: 面向长程智能体的目标性事后自我蒸馏
HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。
GUICrafter:弱监督GUI智能体,利用海量未标注截图
GUICrafter提出了一种弱监督GUI智能体,利用海量未标注截图和两阶段课程学习框架,减少对昂贵人工标注的依赖,仅用UI-TARS系统0.1%的数据即达到了与之竞争的性能。