PANDO:通过在线技能蒸馏实现高效多模态AI代理
摘要
PANDO 是一个网络代理框架,通过在线技能蒸馏提高效率,在 VisualWebArena 任务上减少 58-61% 的令牌使用量,同时优于基线。
查看缓存全文
缓存时间: 2026/05/29 23:04
Paper page - PANDO: 通过在线技能蒸馏实现高效多模态AI智能体
来源: https://huggingface.co/papers/2605.24785
摘要
PANDO是一个网络智能体框架,通过积累经验来减少冗余动作、优化技能发现、增强提示缓存,从而在提升效率的同时不牺牲性能。
近期多模态网络智能体(https://huggingface.co/papers?q=multimodal%20web%20agents)的进步往往依赖于增加推理时的计算量,包括展开搜索(https://huggingface.co/papers?q=rollout%20search)、验证器轮次(https://huggingface.co/papers?q=verifier%20passes)、离线技能发现(https://huggingface.co/papers?q=offline%20skill%20discovery)以及专家模型堆栈(https://huggingface.co/papers?q=specialist%20model%20stacks)。这引出了一个核心问题:网络智能体能否随着经验积累变得更高效,而非更昂贵?我们首先分析了来自VisualWebArena(https://huggingface.co/papers?q=VisualWebArena)的轨迹,识别出三个反复出现的低效根源:重复动作循环、隐藏的发现成本以及较低的提示缓存复用率。随后,我们引入了PANDO,这是一个单次展开的在线技能蒸馏框架(https://huggingface.co/papers?q=skill-distillation%20framework),它维护一个结构化的技能库(https://huggingface.co/papers?q=Skill%20Library),并结合了进步反思(https://huggingface.co/papers?q=progress%20reflection)、基于置信度的技能降级(https://huggingface.co/papers?q=confidence-based%20skill%20demotion)、分层路由(https://huggingface.co/papers?q=hierarchical%20routing)、视觉压缩(https://huggingface.co/papers?q=visual%20compression)以及缓存感知提示(https://huggingface.co/papers?q=cache-aware%20prompting)。在全部910个VisualWebArena(https://huggingface.co/papers?q=VisualWebArena)任务上,PANDO实现了58.3%的成功率,优于SGV(54.0%)和我们复现的WALT(45.2%),同时令牌使用量比SGV减少58%,比WALT减少61%,且无需任何预评估发现预算。进一步的300任务消融实验表明,规则和例程贡献了大部分成功提升,而路由、压缩和缓存感知提示(https://huggingface.co/papers?q=cache-aware%20prompting)则将在更大技能库(https://huggingface.co/papers?q=skill%20library)下的边际令牌成本降低。最后,我们引入了三个轨迹级效率指标——动作重复率(https://huggingface.co/papers?q=Action%20Repetition%20Rate)、步骤开销比(https://huggingface.co/papers?q=Step%20Overhead%20Ratio)和提示缓存利用率(https://huggingface.co/papers?q=Prompt%20Cache%20Utilization)——使得效率在终端成功之外变得可见。
查看arXiv页面(https://arxiv.org/abs/2605.24785)查看PDF(https://arxiv.org/pdf/2605.24785)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.24785)
在你的智能体中获取这篇论文:
hf papers read 2605.24785
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
尚无模型链接此论文
在模型README.md中引用arxiv.org/abs/2605.24785,即可从本页链接。
引用此论文的数据集0
尚无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2605.24785,即可从本页链接。
引用此论文的 Spaces0
尚无Space链接此论文
在Space README.md中引用arxiv.org/abs/2605.24785,即可从本页链接。
包含此论文的收藏集0
尚无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)中,即可从本页链接。
相似文章
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
@dair_ai: 如果你在构建 Web 代理,这篇关于如何让代理技能可复用的文章值得你花时间阅读。(收藏它)LLM web…
本文介绍了 SkillMigrator,一个 LLM Web 代理,它通过匹配布局结构而非领域特定元数据来学习可复用技能并在网站间迁移这些技能,在 WebArena 和 Mind2Web 基准测试中将 LLM 操作次数减少了 8-10%。
基于状态感知动态检索的Web智能体在线技能学习
本文提出了SGDR(State-Grounded Dynamic Retrieval,状态感知动态检索),一种面向Web智能体的在线技能学习方法,支持逐步、感知当前状态的技能复用,而非静态的任务级检索。在WebArena上的实验表明,SGDR结合GPT-4.1可达到37.5%的成功率,相较于强基线取得了约10.6%的相对提升。
@dair_ai: 终于,有一篇好论文测试了 Agent Skills 是否真的有帮助。如果你正在维护技能库,值得一读 …
一项基准研究表明,在 Web 开发任务中注入 Agent Skills 通常会降低性能并增加令牌成本,存在长度分散和内容误导等失败模式,凸显了按部署评估的必要性。
UI-MOPD:面向持续GUI智能体学习的多平台在线策略蒸馏
本文提出UI-MOPD方法,将多教师在线策略蒸馏与持续学习相结合,用于跨平台训练GUI智能体,同时介绍了Uni-GUI数据集。该方法在OSWorld和MobileWorld上分别达到38.2%和12.0%的任务成功率,展示了有效的跨平台能力保持与适应。