iFLYTEK-Embodied-Omni Technical Report
摘要
本技术报告介绍了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,采用脑-小脑协作架构和四阶段训练策略,联合建模视觉、语言和动作,用于具身智能体。
arXiv:2607.02542v1 公告类型:新
摘要:通用具身智能体必须理解多模态指令,预测环境将如何演变,并在较长时间内产生精确的控制动作。现有方法通常专注于视觉-语言推理、基于视频的世界建模或动作生成,而级联管道首先合成未来观察结果,然后推断动作,可能会引入接口瓶颈并加剧预测误差。我们提出了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,在单个 Omni 框架内联合建模视觉(视频和图像)、语言和动作。其特定模态的视觉-语言、视频生成和动作生成组件通过共享的多模态自注意力进行通信。这种设计建立了脑-小脑协作:视觉-语言模型和视频生成模型形成高级脑,用于指令理解、任务规划、进度跟踪和未来视觉状态预测,而动作生成模型作为低级小脑,直接将规划的子目标和共享的多模态上下文转换为可执行的动作块。为了开发这些能力,我们结合了来自人类演示和机器人交互的带有动作标注和无动作标注的具身视频,以及具身推理、具身感知和通用图像-文本数据,构建了一个全面的数据集。我们进一步采用四阶段策略,逐步训练 VLM、VGM 和 AGM,然后联合微调整个模型。
查看缓存全文
缓存时间: 2026/07/07 04:34
# iFLYTEK-Embodied-Omni 技术报告 来源:https://arxiv.org/abs/2607.02542 作者:Yuan Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Y),Jingfei Ni (https://arxiv.org/search/cs?searchtype=author&query=Ni,+J),Guanchen Lu (https://arxiv.org/search/cs?searchtype=author&query=Lu,+G),Shiqi Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+S),Qingshan Xu (https://arxiv.org/search/cs?searchtype=author&query=Xu,+Q),Chi Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+C),Xin Nie (https://arxiv.org/search/cs?searchtype=author&query=Nie,+X),Wenjie Xu (https://arxiv.org/search/cs?searchtype=author&query=Xu,+W),Lin Gao (https://arxiv.org/search/cs?searchtype=author&query=Gao,+L),Zhiyuan Cheng (https://arxiv.org/search/cs?searchtype=author&query=Cheng,+Z),Mingxin Zhou (https://arxiv.org/search/cs?searchtype=author&query=Zhou,+M),Jiajia Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+J),Diyuan Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+D),Jia Pan (https://arxiv.org/search/cs?searchtype=author&query=Pan,+J),Chao Ji (https://arxiv.org/search/cs?searchtype=author&query=Ji,+C) 查看 PDF (https://arxiv.org/pdf/2607.02542) > **摘要:**通用具身智能体需要理解多模态指令,预测环境如何演变,并在较长的时间跨度内生成精确的控制动作。现有方法通常专注于视觉-语言推理、基于视频的世界建模或动作生成,而先合成未来观测值再推导动作的级联流水线则可能引入接口瓶颈并加剧预测误差。我们提出了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,在单个 Omni 框架内联合建模视觉(视频和图像)、语言和动作。其特定模态的视觉-语言、视频生成和动作生成组件通过共享的多模态自注意力进行通信。这种设计建立了脑-小脑协作:视觉-语言模型和视频生成模型构成高级脑,负责指令理解、任务规划、进度跟踪和未来视觉状态预测;而动作生成模型则充当低级小脑,直接将计划好的子目标和共享的多模态上下文转换为可执行的动作块。为培养这些能力,我们结合了来自人类示教和机器人交互的带动作标注和无动作标注的具身视频,以及具身推理、具身感知和通用图像-文本数据,构建了一个全面的数据集。我们进一步采用四阶段策略,先逐步训练 VLM、VGM 和 AGM,再对完整模型进行联合微调。 ## 提交历史 来自:Yuan Zhang [查看邮箱](https://arxiv.org/show-email/d6dca6f9/2607.02542) **\[v1\]** 2026年6月24日星期三 00:25:44 UTC (3,114 KB)
相似文章
tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face
腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。
X-OmniClaw 技术报告:一种用于多模态理解与交互的统一移动智能体
本报告介绍了 X-OmniClaw,这是一个专为 Android 设备设计的统一移动智能体系统,旨在实现多模态理解与交互。报告详细阐述了其利用设备端 AI 能力进行感知、记忆管理及动作执行的架构。
Embodied-R1.5: 通过具身基础模型进化物理智能
Embodied-R1.5 是一个统一的具身基础模型,通过多任务平衡强化学习在 24 个具身视觉-语言基准测试中的 16 个上取得了最先进性能。它引入了一个规划器-接地器-校正器闭环框架用于长视界任务,并且已开源以促进未来研究。
tencent/HY-Embodied-0.5
腾讯发布了HY-Embodied-0.5,这是一套为具身AI智能体设计的基础模型套件,采用混合变换器(MoT)架构,提供高效的2B和强大的32B变体,用于真实世界的机器人控制和时空推理。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。