PalmClaw: 一种原生设备内手机代理框架

arXiv cs.CL 论文

摘要

PalmClaw 是一个开源代理框架,原生运行在手机上,将设备功能暴露为具有明确执行边界的显式工具。与基线相比,任务成功率提升 11.5%,完成时间减少 94.9%。

arXiv:2607.13027v1 公告类型:新 摘要:大型语言模型(LLM)代理已经超越生成响应,通过调用工具、观察结果并迭代决定下一步行动来执行多步骤任务。大多数代理系统运行在桌面或服务器上,支持工具使用和任务自动化。移动设备也是重要的代理环境,因为它们广泛可访问,包含用户数据、传感器和日常应用。现有的移动代理主要通过图形用户界面(GUI)操作(如点击、滑动和输入)来操作智能手机,这些操作通常形成长且依赖界面的序列,无法直接访问设备功能,且难以定义执行边界。我们提出 \textbf{PalmClaw},一个在手机上原生运行的开源代理框架,直接在设备上管理会话、记忆、技能、工具和代理循环。PalmClaw 将设备功能公开为具有明确参数、结构化结果和清晰定义执行边界的设备工具。这种设计使代理能够直接使用移动功能,同时保持每个动作明确且受控。实验表明,与最强基线相比,任务成功率相对提高 11.5%,完成时间减少 94.9%,且设置负担更低,轨迹展示了执行边界的应用方式。代码可在 https://github.com/ModalityDance/PalmClaw 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# PalmClaw:一种原生移动设备端Agent框架

来源:https://arxiv.org/html/2607.13027  
Hongru Cai¹  Yongqi Li¹\advisor  Ran Wei²  Wenjie Li¹  
¹香港理工大学 ²杭州迪安诊断生物技术有限公司  
{henry.hongrucai, liyongqi0}@gmail.com

###### 摘要

大型语言模型(LLM)智能体已从生成回复发展为通过调用工具、观察结果并迭代决定下一步行动来执行多步骤任务。大多数智能体系统运行在桌面或服务器上,支持工具使用和任务自动化。移动设备同样是重要的智能体环境,因为它们广泛可用且包含用户的数据、传感器和日常应用。现有移动智能体主要通过图形用户界面(GUI)动作(如点击、滑动和输入)操控智能手机,这些动作通常形成冗长且依赖界面的序列,无法直接访问设备能力,且执行边界难以界定。我们提出PalmClaw,一个开源智能体框架,它原生运行于手机端,并直接在设备上管理会话、记忆、技能、工具和智能体循环。PalmClaw将设备能力作为设备工具暴露出来,这些工具具有明确的参数、结构化的结果和清晰定义的执行边界。这种设计使得智能体能够直接使用移动能力,同时保持每个动作的明确性和可控性。实验表明,与最强基线相比,任务成功率相对提升11.5%,完成时间减少94.9%,且设置负担更低,追踪示例展示了执行边界的应用方式。

## 1 引言

近年来,大型语言模型(LLM)智能体已从生成回复发展到在外部环境中执行任务[yao2023react, schick2023toolformer, li2026clawsbench]。给定一个复杂的用户指令,智能体可以将任务分解为多个步骤,调用工具,观察结果,并迭代决定下一步行动,直至任务完成[openclawGettingStarted, gao2025agentscope10developercentricframework]。这种迭代交互使得智能体不仅能提供建议,更重要的是能自主执行信息搜索[zhu2026gisa]、文件管理[xie2024osworld, li2026clawsbench]和工作流自动化[xu2025theagentcompany]等任务。

参见图注图1:PalmClaw概述。(a) 外部托管的移动智能体在桌面或云主机与手机之间交换GUI状态和GUI动作。(b) PalmClaw在移动设备上运行智能体组件,并通过设备工具将它们连接到设备资源和能力。

智能体本质上是基于基础LLM的框架,通过整合指令、持久记忆、可复用技能、可执行工具、会话管理和迭代智能体循环而构成。这些组件共同使智能体能够检索相关记忆和会话历史,加载任务特定的指令和技能,调用LLM,执行工具,并将产生的观察结果反馈到后续轮次中。代表性的智能体框架,如AutoGen[wu2023autogen]、AgentScope[gao2025agentscope10developercentricframework]和OpenClaw[openclawGettingStarted],将这些组件托管在桌面计算机或云服务器上。

尽管桌面和服务器平台为智能体提供了丰富且实用的环境,但我们认为原生支持移动设备上的智能体同样重要。首先,手机是最广泛可用的个人计算设备之一,全球10岁及以上人群中每五人就有四人拥有手机[itu2024mobileownership]。这种广泛的可用性使得移动原生智能体能够覆盖那些可能无法持续访问个人电脑的用户。其次,智能手机存储高度个人化的数据,提供摄像头、麦克风和位置等传感器,并承载日常使用的众多应用[wang2024mobileagentbenchefficientuserfriendlybenchmark]。因此,直接在智能手机上运行智能体可以使它们更靠近用户、设备资源以及日常任务所需的能力。

尽管有这种潜力,现有移动智能体主要通过GUI动作(如点击、滑动和输入)来操控智能手机(见图1(a))[wang2024mobileagentbenchefficientuserfriendlybenchmark, zhang-etal-2025-agentcpm, ye2025mobileagentv3fundamentalagentsgui]。虽然这种方法与现有应用广泛兼容,但它存在三个局限性:1) 高层级任务变为冗长的动作序列,对布局变化和复杂界面敏感;2) 无法直接访问设备资源和能力,例如本地文件和传感器数据;3) GUI控制授予了访问可达界面的广泛权限,缺乏明确的特定任务访问限制或执行边界。因此,GUI交互对于一般屏幕操作很有用,但作为移动智能体的唯一动作空间是不够的。近期终端原生智能体的兴起,如Codex CLI[openaiCodexCLI]、Claude Code[anthropicClaudeCode]和Gemini CLI[googleGeminiCLI],反映了向明确且可执行的基于工具交互的更广泛转变,这激发了移动智能体类似的原生设备端设计。

我们提出PalmClaw,一个开源智能体框架,设计为在移动环境内原生运行¹¹PalmClaw以AGPLv3许可证发布。可安装包可从https://github.com/ModalityDance/PalmClaw/releases/latest获取。。如图1(b)所示,PalmClaw在移动设备上运行智能体循环并管理其记忆、技能、工具和会话状态。它通过设备工具暴露设备资源和能力:这些设备操作具有明确的参数、结构化的结果和特定于工具的执行边界。综合来看,我们的框架减少了对智能体编排的外部桌面或服务器设备的依赖,使智能体能够更直接地使用移动能力,并保持每个移动动作的明确性和有界性。在代表性移动任务上的实验表明,PalmClaw相对于最强基线将任务完成成功率相对提升11.5%,并将平均任务完成时间减少94.9%。部署和追踪分析进一步显示了更低的设置负担,并说明了执行边界的应用方式。

主要贡献如下:

- 我们提出PalmClaw,一个开源移动原生智能体框架,直接在移动设备上托管智能体循环、记忆、技能、工具和会话状态。
- 我们设计了设备工具,通过明确的参数、结构化的结果和特定于工具的执行边界来暴露移动资源和能力。
- 我们在移动任务上评估PalmClaw,显示任务成功率相对提升11.5%,完成时间减少94.9%,设置负担更低,并提供基于追踪的执行边界分析。

## 2 相关工作

#### 通用智能体框架。

LLM智能体通过工具使用、中间观察和多步动作循环扩展了语言模型。ReAct[yao2023react]将推理轨迹与动作连接起来,Toolformer[schick2023toolformer]研究将API调用作为语言建模的一部分。诸如AutoGen[wu2023autogen]、AgentScope[gao2025agentscope10developercentricframework]和OpenClaw[openclawGettingStarted]等框架将这些机制打包成用于实际任务的系统,托管在计算机或云服务器上。PalmClaw则将智能体组件直接托管在移动设备上。

参见图注图2:PalmClaw框架概述。输入被分配到移动会话,在其中组装上下文并执行智能体循环。工具调用在设备上被检查并执行,然后其结果返回给智能体循环。

#### 移动智能体。

移动智能体研究基于LLM的系统如何在智能手机上完成任务。现有工作已开发了移动智能体和基准,包括AndroidWorld[rawles2024androidworlddynamicbenchmarkingenvironment]、MobileAgentBench[wang2024mobileagentbenchefficientuserfriendlybenchmark]、Mobile-Bench[deng-etal-2024-mobile]、AgentCPM-GUI[zhang-etal-2025-agentcpm]和Mobile-Agent-v3.5[xu2026mobile]。相关系统如ApkClaw[apkclawSoftware]、MobileClaw[mobileclawSoftware]和ClawMobile[du2026clawmobile]也探索了使用GUI动作在手机端执行任务。PalmClaw专注于在手机上托管智能体框架,并通过设备工具暴露设备能力。

## 3 框架

本节描述PalmClaw中的智能体组件以及它们在设备端执行期间如何协同工作。

### 3.1 概述

PalmClaw直接在移动设备上运行多步智能体执行所需的组件。如图2所示,会话组织用户交互,记忆保存可复用的信息,技能提供任务特定的指令,工具暴露设备资源和能力。智能体循环通过重复的模型和工具交互来组合这些组件。LLM推理通过远程LLM API提供,而上下文管理、工具执行和会话状态保持在移动设备上。PalmClaw将这些组件集成到一个移动应用中,代表性界面如图6所示。

### 3.2 智能体组件

PalmClaw直接在移动设备上维护会话、记忆、技能和设备工具。

#### 会话。

会话从三个输入源组织持久的智能体交互:本地聊天消息、来自连接远程通道的消息以及由定时唤醒生成的自动消息。每个会话存储其对话历史、工具追踪、附件以及用于文档、临时文件和生成工件的专用工作区。PalmClaw将每个输入路由到现有会话或新会话,允许任务在多个轮次中持续进行,同时保持并发任务分离。

#### 记忆。

PalmClaw维护两个持久记忆层:1) 共享长期记忆,存储跨会话可用的信息,并在每个智能体轮次中包含;2) 每会话摘要,保持任务进展和结论的紧凑记录。当未合并的消息达到可配置的窗口大小时,一个单独的LLM调用会总结较旧的消息并更新这两个层。记忆工具允许智能体读取或更新长期记忆,以及读取或搜索选定会话的历史。

参见图注图3:PalmClaw中的内置技能和工具分组。技能提供可复用的任务指令,而工具暴露设备、个人数据、工作区、网络、通信和自动化能力。

#### 技能。

技能是可复用的任务指令,用于应用工具和完成常见例程,存储在`SKILL.md`文件中。PalmClaw提供内置和用户安装的技能。对于每个轮次,它会将可用技能的摘要添加到上下文中,加载标记为始终激活的技能的完整指令,并通过匹配最近的用户消息与其名称、描述和关键词来选择其他相关技能。只有始终激活的和选定的技能被完整加载,从而提供任务特定的指导,而不必将所有技能加载到上下文中。图3总结了内置技能和工具分组。

#### 工具。

设备工具将模型生成的工具调用连接到手机上可用的资源和能力。每个工具连接一个面向模型的规范(包含其名称、描述和JSON参数模式)和一个面向设备的函数(调用移动服务或应用管理的操作)。PalmClaw将规范发送给LLM,在被调用时执行关联的函数,并返回结构化的结果或错误。内置设备工具涵盖设备状态和权限、媒体、蓝牙、日历和联系人以及工作区文件;其他工具分组支持网络访问、记忆、通信和定时自动化。

### 3.3 智能体执行

这些组件通过上下文组装、智能体循环和设备工具执行协同工作。

#### 上下文组装。

在输入被分配到会话后,PalmClaw从六个来源组装智能体上下文:1) 来自`AGENT.md`、`SOUL.md`和`USER.md`的系统指令;2) 运行时上下文,包括当前时间、时区、会话ID和工作区路径;3) 共享长期记忆;4) 活跃技能指令和可用技能摘要;5) 最近的对话历史、附件和工具追踪;6) 可用工具规范,包括其名称、描述和参数模式。前五个来源构成模型消息,而工具规范与它们一起提供给远程LLM API。图5显示了这种上下文的示例。

#### 智能体循环。

PalmClaw将每个智能体轮次作为一个有界的多轮循环运行,连接远程LLM推理与设备端工具执行[yao2023react, schick2023toolformer]。在每一轮中,PalmClaw从当前会话状态重建上下文,将模型消息和可用工具规范发送给远程LLM API,并将返回的助手消息存储在会话中。如果响应包含工具调用,PalmClaw执行它们,将结果追加到会话,并以更新后的上下文开始下一轮。如果响应不包含工具调用,它就成为最终回复。循环也在工具发出任务完成信号或达到轮次限制时结束。

#### 工具执行。

来自智能体循环的工具调用进入图2所示的设备工具执行路径。PalmClaw首先将每个调用匹配到工具注册表。在执行相应操作之前,调用需经过三项检查:1) **模式**验证必需参数、类型和允许范围。2) **权限**包括设备授权和用户确认。缺少的权限会触发系统权限或设置流程,而需要用户直接参与的动作仅在用户确认或完成后才继续。3) **工作区**解析当前会话工作区或批准的共享存储内的文件路径,拒绝其他会话工作区和未批准的全局路径,并要求在外部写入前确认。通过这些检查的调用会针对相应的设备资源或能力执行。其结构化结果返回给会话用于下一轮;如果检查失败或用户拒绝,PalmClaw返回结构化错误。

表1:任务完成结果。MobileTask报告成功率、每任务平均动作数、总Token数和完成时间;AssistantBench报告选定开发子集上的官方准确率。

| 框架      | 主机      | 动作空间                | MobileTask                                                                 |            |            |             | AssistantBench |
|-----------|-----------|-------------------------|----------------------------------------------------------------------------|------------|------------|-------------|----------------|
|           |           |                         | 动作数↓ | Token↓ | 时间↓ | 成功率↑ | 准确率↑ |
| MobileClaw | 桌面      | GUI动作                 | 94.3       | 1.30M     | 1197.0s    | 60.0%       | 5.26%          |
| ClawMobile | Termux    | API和GUI动作            | 51.4       | 466.4K    | 451.1s     | 77.1%       | 10.49%         |
| ApkClaw   | 移动应用  | GUI动作                 | 103.9      | 2.06M     | 348.8s     | 87.1%       | 25.79%         |
| PalmClaw  | 移动应用  | 设备工具                | 2.8        | 50.4K     | 17.7s      | 97.1%       | 36.85%         |

## 4 评估

我们通过三个问题评估PalmClaw的设备端智能体框架:

- RQ1:PalmClaw是否通过其设备端智能体框架和设备工具支持有效的移动任务完成?
- RQ2:将智能体框架托管在移动设备上是否能减少外部部署和操作需求?
- RQ3:执行边界是如何应用的?

相似文章

OpenClaw 终于登陆 Android 和 iOS

TechCrunch AI

OpenClaw,这款开源的 AI 代理平台,已在 iOS 和 Android 上推出移动应用,用户可以通过 OpenClaw Gateway 在手机上运行代理。

@interjc: openclaw 都有手机 app 了

X AI KOLs Following

OpenClaw 已为 iOS 和 Android 推出原生移动应用,让用户能够随时随地运行 AI 代理,支持频道、任务和回复等功能。