全交互智能体技术报告

Hugging Face Daily Papers 论文

摘要

本文提出Gander,一个用于全交互和智能体任务的端到端框架,通过Cerebellum-Brain架构实现跨多种模态的实时全双工交互。

在本文中,我们提出Gander,一个端到端模型,它将全感知、实时交互和智能体能力统一在一个框架内。与传统的回合制范式不同,Gander持续接收跨多种模态的流式输入,包括视频、语音和文本,从而在日常对话和复杂的以工作流为导向的智能体场景中实现自然的全双工交互。用户可以随时打断模型,而模型也可以主动提供中间反馈或提出后续问题。为了原生支持这些能力,Gander采用了两个关键架构设计:1) 它采用Cerebellum-Brain协作框架,其中Cerebellum负责实时交互和全交互对话能力,而Brain处理复杂推理和更高级的智能体任务。两个组件通过工具调用和智能体编排运行时持续交互。2) Cerebellum基于流式Thinker-Talker架构构建,用户输入和模型输出在块级别进一步扁平化为有序令牌流,为低延迟、连续交互提供统一表示。我们对Gander进行了四个维度的综合评估:对话能力、全理解、交互能力和智能体智能。内部人类评估表明,Gander保持了SOTA开源模型的自然和富有表现力的口语对话能力,同时在全交互中取得了有竞争力的性能。Gander还在具有挑战性的真实场景中表现出鲁棒性,包括背景噪声干扰、多方交互和反馈通信。我们发布了Gander及其模型、代码和数据,以促进社区的进一步研究和开发。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:33

论文页面 - 全向交互智能体技术报告

来源:https://huggingface.co/papers/2609.08977 发布日期:9月8日

#2 当日精选论文 (https://huggingface.co/papers/date/2026-09-09) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Gander 是一个端到端框架,通过小脑-大脑架构与分块级令牌流设计,整合了持续的多模态流式传输、实时全双工交互与智能体推理能力。

本文提出 Gander,一个将全向感知 (https://huggingface.co/papers?q=omni%20perception)、实时交互与智能体能力统一于单一框架的端到端模型。与传统的轮替式对话范式不同,Gander 持续接收跨多模态的流式输入(包括视频、语音与文本),在日常对话与面向复杂工作流的智能体场景中,均能实现自然的全双工交互 (https://huggingface.co/papers?q=full-duplex%20interaction)。用户可随时打断模型,而模型也能主动提供中间反馈或提出后续问题。为原生支持这些能力,Gander 采用了两项关键架构设计:1)采用小脑-大脑协作框架 (https://huggingface.co/papers?q=Cerebellum-Brain%20collaborative%20framework),其中小脑负责实时交互与全向对话能力,大脑处理复杂推理与更高层级的智能体任务。两个组件通过工具调用 (https://huggingface.co/papers?q=tool%20calling) 与智能体编排运行时 (https://huggingface.co/papers?q=agent%20orchestration%20runtime) 持续交互。2)小脑基于流式思考者-言说者架构 (https://huggingface.co/papers?q=streaming%20Thinker-Talker%20architecture) 构建,用户输入与模型输出在分块级被进一步扁平化为有序的令牌流 (https://huggingface.co/papers?q=token%20stream),为低延迟、持续的交互提供了统一的表示。我们从对话能力、全向理解、交互能力与智能体智能四个维度对 Gander 进行了全面评估。内部人类评估表明,Gander 在保持当前最优开源模型自然且富有表现力的语音对话能力的同时,在全向交互方面达到了有竞争力的性能。Gander 在具有挑战性的真实场景中也表现出鲁棒性,包括背景噪声干扰、多方交互与反向通道通信。我们发布了 Gander 及其模型、代码与数据,以促进社区进一步的研发。

查看 arXiv 页面 (https://arxiv.org/abs/2609.08977) 查看 PDF (https://arxiv.org/pdf/2609.08977) 项目页面 (https://omni-interaction-gander.github.io/Omni-Interaction-Agent/) GitHub18 (https://github.com/Omni-Interaction-Gander/Omni-Interaction-Agent) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.08977)

通过您的智能体获取此论文:

hf papers read 2609\.08977

尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 1

Gander-Omni/Gander 文本转语音• 更新于约 3 小时前 • 7 (https://huggingface.co/Gander-Omni/Gander)

引用此论文的数据集 0

暂无链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2609.08977 以从本页面链接。

引用此论文的空间 0

暂无链接此论文的空间

在空间的 README.md 中引用 arxiv.org/abs/2609.08977 以从本页面链接。

包含此论文的收藏 0

暂无包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

iFLYTEK-Embodied-Omni Technical Report

arXiv cs.AI

本技术报告介绍了 iFLYTEK-Embodied-Omni,这是一个统一的多模态基础模型,采用脑-小脑协作架构和四阶段训练策略,联合建模视觉、语言和动作,用于具身智能体。

原生主动感知作为全模态理解的推理方式

Hugging Face Daily Papers

介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。