全交互智能体技术报告
摘要
本文提出Gander,一个用于全交互和智能体任务的端到端框架,通过Cerebellum-Brain架构实现跨多种模态的实时全双工交互。
查看缓存全文
缓存时间: 2026/09/09 08:33
论文页面 - 全向交互智能体技术报告
来源:https://huggingface.co/papers/2609.08977 发布日期:9月8日
#2 当日精选论文 (https://huggingface.co/papers/date/2026-09-09) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Gander 是一个端到端框架,通过小脑-大脑架构与分块级令牌流设计,整合了持续的多模态流式传输、实时全双工交互与智能体推理能力。
本文提出 Gander,一个将全向感知 (https://huggingface.co/papers?q=omni%20perception)、实时交互与智能体能力统一于单一框架的端到端模型。与传统的轮替式对话范式不同,Gander 持续接收跨多模态的流式输入(包括视频、语音与文本),在日常对话与面向复杂工作流的智能体场景中,均能实现自然的全双工交互 (https://huggingface.co/papers?q=full-duplex%20interaction)。用户可随时打断模型,而模型也能主动提供中间反馈或提出后续问题。为原生支持这些能力,Gander 采用了两项关键架构设计:1)采用小脑-大脑协作框架 (https://huggingface.co/papers?q=Cerebellum-Brain%20collaborative%20framework),其中小脑负责实时交互与全向对话能力,大脑处理复杂推理与更高层级的智能体任务。两个组件通过工具调用 (https://huggingface.co/papers?q=tool%20calling) 与智能体编排运行时 (https://huggingface.co/papers?q=agent%20orchestration%20runtime) 持续交互。2)小脑基于流式思考者-言说者架构 (https://huggingface.co/papers?q=streaming%20Thinker-Talker%20architecture) 构建,用户输入与模型输出在分块级被进一步扁平化为有序的令牌流 (https://huggingface.co/papers?q=token%20stream),为低延迟、持续的交互提供了统一的表示。我们从对话能力、全向理解、交互能力与智能体智能四个维度对 Gander 进行了全面评估。内部人类评估表明,Gander 在保持当前最优开源模型自然且富有表现力的语音对话能力的同时,在全向交互方面达到了有竞争力的性能。Gander 在具有挑战性的真实场景中也表现出鲁棒性,包括背景噪声干扰、多方交互与反向通道通信。我们发布了 Gander 及其模型、代码与数据,以促进社区进一步的研发。
查看 arXiv 页面 (https://arxiv.org/abs/2609.08977) 查看 PDF (https://arxiv.org/pdf/2609.08977) 项目页面 (https://omni-interaction-gander.github.io/Omni-Interaction-Agent/) GitHub18 (https://github.com/Omni-Interaction-Gander/Omni-Interaction-Agent) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.08977)
通过您的智能体获取此论文:
hf papers read 2609\.08977
尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 1
Gander-Omni/Gander 文本转语音• 更新于约 3 小时前 • 7 (https://huggingface.co/Gander-Omni/Gander)
引用此论文的数据集 0
暂无链接此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2609.08977 以从本页面链接。
引用此论文的空间 0
暂无链接此论文的空间
在空间的 README.md 中引用 arxiv.org/abs/2609.08977 以从本页面链接。
包含此论文的收藏 0
暂无包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
X-OmniClaw 技术报告:一种用于多模态理解与交互的统一移动智能体
本报告介绍了 X-OmniClaw,这是一个专为 Android 设备设计的统一移动智能体系统,旨在实现多模态理解与交互。报告详细阐述了其利用设备端 AI 能力进行感知、记忆管理及动作执行的架构。
iFLYTEK-Embodied-Omni Technical Report
本技术报告介绍了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,采用脑-小脑协作架构和四阶段训练策略,联合建模视觉、语言和动作,用于具身智能体。
OmniGUI:在全方位模态智能手机环境中对GUI智能体进行基准测试
OmniGUI引入了一个针对GUI智能体的步骤级基准测试,该测试整合了静态图像、同步音频和视频片段,以模拟真实的智能手机交互。评估显示,当前模型在处理时序和听觉输入方面存在困难,凸显了对全方位模态能力的需求。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
Ex-Omni-2D:具有原生视觉呈现的表现力全模态对话模型
Ex-Omni-2D 是一个全模态对话框架,通过视觉思维计划和蒸馏流式视频生成器,生成协调一致的文本、语音和参考条件视频响应,实现了实用的质量-效率权衡。