X-OmniClaw 技术报告:一种用于多模态理解与交互的统一移动智能体
摘要
本报告介绍了 X-OmniClaw,这是一个专为 Android 设备设计的统一移动智能体系统,旨在实现多模态理解与交互。报告详细阐述了其利用设备端 AI 能力进行感知、记忆管理及动作执行的架构。
查看缓存全文
缓存时间: 2026/05/12 07:32
论文页面 - X-OmniClaw 技术报告:用于多模态理解与交互的统一移动智能体
来源: https://huggingface.co/papers/2605.05765
https://huggingface.co/papers/2605.05765#x-omniclaw-technical-report-a-unified-mobile-agent-for-multimodal-understanding-and-interactionX-OmniClaw 技术报告:用于多模态理解与交互的统一移动智能体
x-omniclaw_structure (https://cdn-uploads.huggingface.co/production/uploads/6379d7333f8f451d6bd0b80b/S5KhTsHBeqOsOCRdUmavF.png)
https://huggingface.co/papers/2605.05765#omni-perception全知感知
fig1 (https://cdn-uploads.huggingface.co/production/uploads/6379d7333f8f451d6bd0b80b/KkRhiMBRte27AhzHhbsKD.png) 多模态入口与统一接入层。 X-OmniClaw 将多样化的输入——直接 UI 触发、浮动小组件、麦克风输入、定时任务以及外部网关——整合到单一管道中。对于重复的设备端任务,Android AlarmManager 提供系统级的唤醒路径,使定时触发器能够重新汇入相同的入口语义。
集成的多模态感知。 手机被建模为基于屏幕 UI、现实世界相机语境和语音的第一人称多模态系统。相机和屏幕投射提供视觉证据;ASR(自动语音识别)实时转录语音;设备端 AEC(声学回声消除)抑制播放回声。解耦的流式管道缓冲视觉历史,时间对齐模块通过时间戳对齐语音和视频。
基于场景的意图理解。 VLM(视觉语言模型)结合用户查询解读场景,将原始输入扩展为意图。可回答的问题立即返回答案;否则,结构化意图被传递给下游智能体循环。
https://huggingface.co/papers/2605.05765#omni-memory全知记忆
fig2 (https://cdn-uploads.huggingface.co/production/uploads/6379d7333f8f451d6bd0b80b/X-mYjysXsnCiF2QFCt-Lt.png)
工作记忆与长期用户记忆。 工作记忆在多轮对话、前台变化和应用切换中保存多模态运行时上下文——包括截图、提炼的观察结果和执行状态——以便任务恢复时不丢失进度。长期记忆将驻留在设备上的个人数据提炼为持久化工件和用户画像表示,并注入推理过程中。
图库与语义记录。 图库照片被转化为紧凑的语义记录(对象、场景、事件),以支持基于事实的问答、检索和自动化。
记忆的构建、使用与安全。 Skills(技能)编排维护与消费;Tools(工具)实现具体步骤。图像管道优先采用多模态摘要,并备有元数据回退方案。生产与消费相分离;写入需经过过滤/脱敏处理;用户控制图库记忆和画像注入。
https://huggingface.co/papers/2605.05765#omni-action全知行动
fig3 (https://cdn-uploads.huggingface.co/production/uploads/6379d7333f8f451d6bd0b80b/NODa3e3PCcfzCYGAzNA07.png) 应用生态中的全知行动。 每个步骤遵循观察、推理和执行。观察栈融合多模态界面证据;循环选择技能、检索记忆,并返回下一步行动或直接回复。执行范围涵盖 Android 原子动作和更高级别的工具(文件系统、RAG 等)。
混合 UI 理解。 XML、设备端定位和 OCR 定位目标:在结构可靠时使用结构,在提示微弱或杂乱时(尤其是在广告和密集布局下)使用视觉和文本。
轨迹克隆执行。 行为克隆将 UI 层导航记录为名命技能;基于 dumpsys 的内省提取 deeplink/intent 快捷方式。轨迹回放恢复目标“地址”,以便快速重新进入,并在 UI 发生漂移时提供回退方案。
相似文章
全交互智能体技术报告
本文提出Gander,一个用于全交互和智能体任务的端到端框架,通过Cerebellum-Brain架构实现跨多种模态的实时全双工交互。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
OpenClaw 与 Ollama 在智能体 AI 中的应用:迈向全自主且可扩展的 AI 智能体系统
本文提出了智能体 AI 的分层架构分析,以 OpenClaw 和 Ollama 作为全栈原型,展示了自主能力如何从系统集成中涌现,并讨论了运行挑战和未来方向。
VisualClaw: 面向物理世界的实时个性化智能体
VisualClaw是一种自我进化的多模态智能体,通过混合编码和技能进化降低部署成本,同时在多个基准测试中提高了视频问答的准确性。
OpenClaw 控制 Android 手机?
讨论名为 OpenClaw 的 AI 代理控制 Android 手机的可能性,暗示此类功能现已存在。