KnowAct-GUIClaw:深度认知,完美执行,具有自我进化记忆和技能的个人GUI助手

arXiv cs.CL 论文

摘要

介绍 KnowAct-GUIClaw,一个具有自我进化记忆和技能的个人GUI助手框架,在MobileWorld基准测试上实现了最先进的性能,并超越了GPT-5.5等闭源模型。

arXiv:2607.12625v1 公告类型:新 摘要:OpenClaw已成为复杂任务自动化的领先智能体框架,但它面临跨平台GUI交互支持不足以及缺乏完善的自我进化机制等问题。这些缺陷限制了其对多样化设备生态系统的适应能力,并阻碍了通过持续从执行经验中学习来提升性能。为解决这些问题,我们提出了个人助手的“Know Deeply, Act Perfectly”范式,该范式认为累积的用户交互和任务执行经验能直接提升执行准确性和效率,统一了认知理解与操作执行。基于这一范式,我们引入了KnowAct-GUIClaw,一个新颖的Know-Route-Act-Reflect框架,旨在解决OpenClaw的GUI操作缺陷,并突破其跨平台和递归自我改进的限制。首先,主智能体利用累积的交互经验和任务相关知识进行长期任务分解与分配(Know)。其次,一个可插拔的GUI子智能体配备有经验可归因的记忆系统(Know)和自我进化的技能库(Act),实现无缝跨平台迁移和快速路径集成。特别地,该框架持续存储用户画像和反馈,以提高任务分解和工具调用的准确性。在Android、iOS、HarmonyOS和Windows上的广泛实验表明,KnowAct-GUIClaw实现了卓越的效率、准确性和跨平台适应性。尤其是,基于开源Kimi-2.6模型的GUIClaw在长期MobileWorld基准测试中取得了最佳性能(64.1%),超越了所有智能体框架和闭源智能体模型,例如Seed-2.0-Pro和GPT-5.5。此外,我们的框架支持的知识性记忆和执行技能可跨不同基础模型迁移,使用Kimi-2.6时提升了8.5%。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# 深知笃行:具备自进化记忆与技能的个人GUI助手
来源:https://arxiv.org/html/2607.12625
Lychee Team, 哈尔滨工业大学, 深圳AI训练平台, 深圳大湾区研究院 [![[无标题图片]](https://arxiv.org/html/2607.12625v1/figures/github-mark.png)代码](https://github.com/HITsz-TMG/KnowAct)[![[无标题图片]](https://arxiv.org/html/2607.12625v1/figures/website-logo.png)网站](https://shibosusu.github.io/KnowAct-GUIClaw/)[![[无标题图片]](https://arxiv.org/html/2607.12625v1/figures/logs-logo.png)实验日志](https://github.com/HITsz-TMG/KnowAct/releases/tag/Result)

###### 摘要

OpenClaw已成为复杂任务自动化的领先智能体框架,但其现有变体面临两个核心瓶颈:对跨平台GUI交互支持不足,以及缺乏内置的自我进化机制。这些缺陷限制了其适配异构设备生态的能力,并阻止了通过从执行经验中持续学习来提升性能。为解决这些问题,我们提出了个人助手的“深知笃行”范式,该范式认为积累的人机交互与任务运行经验能直接提升执行准确率和效率,统一认知理解与操作执行。基于此范式,我们引入了KnowAct-GUIClaw,一种新颖的Know-Route-Act-Reflect框架,旨在解决OpenClaw的GUI操作短板,并突破其跨平台和递归式自我改进的约束。首先,宿主智能体利用积累的交互经验和任务相关知识进行长程任务分解与分配(Know)。其次,一个可插拔的GUI子智能体配备有经验可归因的记忆系统(Know)和自进化技能库(Act),实现无缝跨平台迁移和快速路径集成。特别地,该框架持续存储用户画像和反馈,以提高任务分解和工具调用的准确性。在Android、iOS、HarmonyOS和Windows上的大量实验表明,KnowAct-GUIClaw在UI操作效率、准确度和跨平台适应性方面均表现出色。尤其地,基于开源Kimi-2.6模型的GUIClaw在长程MobileWorld基准上取得了最佳性能(64.1%),超越了所有智能框架和闭源智能模型,如Seed-2.0-Pro和GPT-5.5。此外,我们框架所支持的知识记忆和执行技能可跨不同基础模型迁移,在Kimi-2.6上提升8.5%,在Qwen3.5-35B-A3B上提升16.2%。

参见图注 图1:MobileWorld GUI-only任务上的成功率(SR)对比。条形图汇总了表1(https://arxiv.org/html/2607.12625#S5.T1)以及额外的基于Kimi的KnowAct-GUIClaw运行结果;灰色条形表示专用GUI模型,彩色外部条形表示通用模型家族,高亮条形表示带有记忆和技能的KnowAct-GUIClaw变体。实验结果表明KnowAct-GUIClaw达到了SOTA性能,且记忆和技能对不同基础模型均有效。

###### 目录

1. 1 引言 (https://arxiv.org/html/2607.12625#S1)
2. 2 相关工作 (https://arxiv.org/html/2607.12625#S2)
   1. 2.1 个人助手智能体 (https://arxiv.org/html/2607.12625#S2.SS1)
   2. 2.2 GUI智能体 (https://arxiv.org/html/2607.12625#S2.SS2)
   3. 2.3 记忆与技能复用 (https://arxiv.org/html/2607.12625#S2.SS3)
3. 3 预备知识 (https://arxiv.org/html/2607.12625#S3)
   1. 3.1 作为POMDP的GUI自动化 (https://arxiv.org/html/2607.12625#S3.SS1)
   2. 3.2 以宿主为中心的多智能体系统 (https://arxiv.org/html/2607.12625#S3.SS2)
4. 4 KnowAct-GUIClaw (https://arxiv.org/html/2607.12625#S4)
   1. 4.1 概述:Know–Route–Act–Reflect堆栈 (https://arxiv.org/html/2607.12625#S4.SS1)
   2. 4.2 Know:上下文收集与宿主控制 (https://arxiv.org/html/2607.12625#S4.SS2)
   3. 4.3 Route:任务分解与信息契约 (https://arxiv.org/html/2607.12625#S4.SS3)
   4. 4.4 Act:混合GUI–快速路径执行 (https://arxiv.org/html/2607.12625#S4.SS4)
   5. 4.5 Reflect:轨迹蒸馏与技能进化 (https://arxiv.org/html/2607.12625#S4.SS5)
5. 5 实验 (https://arxiv.org/html/2607.12625#S5)
   1. 5.1 基准与指标 (https://arxiv.org/html/2607.12625#S5.SS1)
   2. 5.2 MobileWorld主要结果 (https://arxiv.org/html/2607.12625#S5.SS2)
   3. 5.3 消融与效率分析 (https://arxiv.org/html/2607.12625#S5.SS3)
   4. 5.4 AndroidDaily结果 (https://arxiv.org/html/2607.12625#S5.SS4)
   5. 5.5 案例研究 (https://arxiv.org/html/2607.12625#S5.SS5)
   6. 5.6 跨平台检查 (https://arxiv.org/html/2607.12625#S5.SS6)
   7. 5.7 可复现性 (https://arxiv.org/html/2607.12625#S5.SS7)
6. 6 结论 (https://arxiv.org/html/2607.12625#S6)
7. 7 贡献者 (https://arxiv.org/html/2607.12625#S7)
8. 参考文献 (https://arxiv.org/html/2607.12625#bib)
9. A 补充案例研究 (https://arxiv.org/html/2607.12625#A1)
10. B 行动空间 (https://arxiv.org/html/2607.12625#A2)
11. C 技能提取与提示契约 (https://arxiv.org/html/2607.12625#A3)
12. D 技能与快捷方式示例 (https://arxiv.org/html/2607.12625#A4)

## 1 引言

大型语言模型(LLM)智能体正从一次性对话机器人转变为有状态、长时间运行的个人助手。它们处理来自不同输入渠道的用户请求,保留持久工作区状态,调用外部工具,协调辅助子智能体,并恢复中断的长时工作流。两条主导性的架构路线推动着它们的发展:基于ReAct的智能体统一了逻辑推理和与环境动作的执行(yao2023reactsynergizingreasoningacting),而通用自主智能体框架则将规划、记忆、工具利用和多智能体对话模块化为可互换的运行时构件(zhou2023agentsopensourceframeworkautonomous)。实际部署的系统——OpenClaw、Nanobot和Hermes——将这些基础设计集成为本地优先的助手平台,具有内置的渠道路由、工具扩展、可配置技能、会话持久化和结构化记忆存储(openclaw2026; nanobot2026; hermesagent2026)。作为能力强大的自主个人助手,这些平台能够通过目标导向的外部工具调用,自主分解并实现复杂的用户目标。

然而,许多现实世界的用户任务需要与图形用户界面(GUI)交互,而非良好结构化的标准化应用程序接口(API)。例如,个人助手可能需要检查移动应用、跨不同应用迁移数据、处理权限弹出对话框,或在受登录保护的环境中执行多步骤工作流。近期跨越Web、移动和桌面平台的基准共同表明,GUI操作带来了独特的挑战,需要视觉定位、序列决策制定以及在动态变化的界面状态下具有弹性的执行(deng2023mind2webgeneralistagentweb; zhou2024webarenarealisticwebenvironment; koh2024visualwebarenaevaluatingmultimodalagents; xie2024osworldbenchmarkingmultimodalagents; rawles2025androidworlddynamicbenchmarkingenvironment; li2026windowsworld)。一系列专用的GUI智能体——包括AppAgent、Mobile-Agent、CogAgent、OS-Atlas、ShowUI、UI-TARS和Aguvis——在完全基于屏幕截图的模态GUI动作生成方面取得了显著进展(zhang2023appagentmultimodalagentssmartphone; wang2024mobileagentautonomousmultimodalmobile; hong2024cogagentvisuallanguagemodel; wu2024osatlasfoundationactionmodel; lin2024showuivisionlanguageactionmodelgui; qin2025uitarspioneeringautomatedgui; xu2025aguvisunifiedpurevision)。因此,一个自然的研究问题出现了:如何赋予OpenClaw风格的智能体高效地与视觉图形环境交互的能力?

一个直接的方法是将独立的GUI智能体集成到OpenClaw框架中。当部署于长程个人助手任务时,这种方法由于四个缺陷而遭受严重的低效和脆弱性:首先,高级用户指令通常跨越多个不相关的应用程序。简洁的自由文本摘要往往无法保留从一个应用中提取的中间数据值以供后续跨应用操作使用。相反,对于模糊的任务,不考虑设备环境而硬性地指定明确的目标应用标签,常常导致虚假的应用分配幻觉。其次,GUI观测本质上是部分可观测的。每种单独的数据模态——屏幕截图、无障碍树、前台应用ID、历史动作轨迹以及内部模型推理日志——只揭示了底层设备状态的部分片断。这需要宿主智能体记录历史轨迹,并为轻量级GUI智能体提供可操作指导。第三,成功和失败的轨迹通常在任务终止后被丢弃。当再次运行类似任务时,智能体被迫重新启动目标应用、重复冗余的导航步骤,并从头重新学习已知捷径和重复出现的失败模式。最后,大多数GUI工作流并未集成更快的非视觉快捷方式,例如网络搜索工具、Android深层链接、系统意图以及可重用的预定义动作序列。而且,如果没有针对实时界面页面的验证,这些快捷方式无法安全地作为持久性长期技能重新利用。

本文提出KnowAct-GUIClaw,一个以结构化知识和可执行技能增强的智能体框架,构建于OpenClaw风格的宿主运行时和以GUI为中心的智能体执行引擎之上。该框架包含两个核心功能组件:一个基于归因策略增强的个性化记忆系统,以及一个支持快速技能调用和迭代优化的自进化技能库。其设计遵循一个简单的原则:*深知笃行*。在行动之前,智能体从所有智能体的记忆中检索与任务相关的应用候选项、工具、策略和GUI提示。在行动过程中,它将GUI控制视为一个部分可观测的决策过程,并记录结构化的轨迹证据或技能。在行动之后,它将有用的轨迹转化为技能库或通用化记忆,使得未来的运行可以利用操作知识,而无需重复探索行为。具体而言,KnowAct-GUIClaw将GUI自动化视为一个能力强大的宿主智能体和一个轻量级GUI执行器之间的协作,而非单一的巨型GUI智能体。宿主拥有面向用户的上下文——对话、工作区记忆、用户画像、外部工具和编排——并决定“做什么”以及可以使用哪个“CLI工具”;GUI执行器拥有截图感知、动作归一化、设备后端、技能验证和轨迹记录,并决定“如何在屏幕上执行”。以这种方式来框架化问题,使得效率成为首要目标:系统仅在真正需要视觉交互时才调用GUI子智能体,并尽可能复用已验证的操作技能和快速CLI工具。

在此基础之上,KnowAct-GUIClaw贡献了四个相互关联的机制。

- •**双层宿主-执行器协作。** 我们设计了一个结构化的、可恢复的GUI任务接口。宿主可以将有限的GUI任务分配给执行器,并检索标准化输出(完全完成、部分完成或受阻),以及进度更新和恢复提示。未完成或停滞的任务运行充当可复用的检查点:宿主不必发送一条模糊的命令,而是可以恢复未完成的执行,或重新安排后续工作流。我们还采用了一种自适应的宿主介入规则,即宿主直接处理符合条件的信息收集子任务(使用工具),而不是将所有子任务转发给GUI执行器。这提高了任务成功率并降低了计算开销。
- •**基于记忆的路由与信息传递。** 一个内置的路由机制将用户请求分类为单应用任务或跨应用工作流(跨越多个应用程序)。对于跨应用序列,每个子任务明确定义其输入和输出数据。一个临时的共享数据板将这些结构化值在子任务间传递,而持久化的路由记忆则提供固定的候选应用和辅助参考上下文。
- •**知识与技能增强的GUI执行。** KnowAct-GUIClaw将轨迹蒸馏为参数化的、经过状态验证的技能,使执行器能够将可复用的动作前缀作为一个单一决策提交。同样的抽象涵盖了常见的“点击然后输入”模式以及Android深层链接和意图快捷方式——仅当它们的启动行为和目标页面状态满足技能契约时才被采用。
- •**轨迹衍生的记忆与技能进化。** 运行后的反思总结轨迹,将成功和失败的经验教训蒸馏为可检索的经验记忆,并根据新积累的证据完善技能集。这些知识在任务分解前反馈给基于记忆的路由器,并在执行过程中反馈给执行器,形成一个从过去运行到未来决策的闭环。

广泛的实验结果表明,我们的模型在具有挑战性的MobileWorld基准上达到了SOTA性能,同时实现了跨平台部署以及记忆与技能的迁移。

## 2 相关工作

### 2.1 个人助手智能体

LLM智能体运行时将语言模型与动作接口、记忆和控制循环配对,如ReAct(yao2023reactsynergizingreasoningacting)、Agents框架(zhou2023agentsopensourceframeworkautonomous)和OS-Copilot(wu2024oscopilotgeneralistcomputeragents)。近年来,当这种模式被封装为本地优先的助手时,出现了两种显著的设计理念。OpenClaw和Nanobot是以配置为中心的:宿主将消息通道、外部工具和模型上下文协议(MCP)服务器、对话历史和会话状态、长期工作区记忆以及用户编写的技能作为一等、可声明的组件公开,使得大多数行为围绕模型指定,而非留给模型自身(openclaw2026; nanobot2026)。相反,Hermes则突出适应性,通过将先前的交互转化为助手后续可调用的可重用例程,随时间增长其能力(hermesagent2026)。两种方向都表明,一个能力强大的个人助手受益于将控制逻辑、记忆、工具和历史作为围绕模型管理的状态来处理。

### 2.2 GUI智能体

GUI和计算机使用智能体研究语言模型如何通过视觉界面而非干净的API来行动。在Web上,Mind2Web和WebArena通过HTML和无障碍树观测暴露了跨越真实网站的长程导航(deng2023mind2webgeneralistagentweb; zhou2024webarenarealisticwebenvironment),而VisualWebArena增加了在渲染页面上基于视觉的决策制定(koh2024visualwebarenaevaluatingmultimodalagents),SeeAct和WebVoyager则探索了基于截图和页面结构的控制(zheng2024gpt4visiongeneralistwebagent; he2024webvoyagerbuildingendtoendweb)。在浏览器之外,Android in the Wild和AndroidWorld提供了大规模演示和动态、程序化检查的任务(rawles2023androidwildlargescaledataset; rawles2025androidworlddynamicbenchmarkingenvironment),OSWorld和OmniACT覆盖了更广泛的桌面和Web计算机使用环境(xie2024osworldbenchmarkingmultimodalagents; kapoor2024omniactdatasetbenchmarkenabling),AppAgent和Mobile-Agent解决了智能手机上的GUI自动化(zhang2023appagentmultimodalagentssmartphone; wang2024mobileagentautonomousmultimodalmobile)。

相似文章

面向GUI代理的技能引导连续蒸馏

arXiv cs.AI

该论文提出了技能引导连续蒸馏(SGCD),这是一个迭代式自我改进框架,利用技能引导策略在闭环执行过程中为偏离轨迹的状态生成监督信号,将OSWorld-Verified上GUI代理的成功率从约30%提升至超过50%。

计算机使用代理

OpenAI Blog

# 计算机使用代理 来源: [https://openai.com/index/computer-using-agent/](https://openai.com/index/computer-using-agent/) 通过计算机使用代理(Computer-Using Agent)为Operator提供支持,这是AI与数字世界交互的通用接口。今天我们推出了[Operator⁠\(在新窗口中打开\)](https://operator.chatgpt.com/)的研究预览版,这是一个能够在网络上为你执行任务的代理。Operator由计算机使用代理(CUA)驱动,这是一个结合了GPT-4o视觉功能的模型