BrainJanus:一个统一的大脑、视觉与语言理解与生成模型

Hugging Face Daily Papers 论文

摘要

BrainJanus是首个统一的大脑模型,通过共享的Omni空间整合大脑、视觉与语言,利用分词表征和自回归下一个token预测实现神经活动与感官刺激的双向映射。

建立外部感官刺激与内部神经活动之间的双向对应关系已成为神经科学中的关键前沿。然而,现有方法主要将大脑编码和解码视为孤立任务,严重依赖单模态对齐和外部先验,忽略了大脑作为多模态整合系统的内在本质。为了解决这些局限性,我们提出了BrainJanus,这是首个在单一框架内整合大脑、视觉与语言的统一大脑模型。具体来说,我们引入了一个统一大脑分词器(Unified Brain Tokenizer),将连续的神经动态量化为离散的token,并在共享的Omni空间中与视觉和语言表征对齐。在此基础上,我们利用All-in-One自回归架构,通过下一token预测实现无缝的任意到任意生成,包括图像到大脑和文本到大脑的编码,以及大脑到图像和大脑到文本的解码。大量实验表明,BrainJanus在多个基准上取得了优越的性能。此外,我们的框架展现出零样本泛化能力,并保留了可解释的生物拓扑结构,突显了其作为通用大脑建模范式的潜力。代码可在https://github.com/HaitaoWuTJU/BrainJanus{GitHub}获取。
查看原文
查看缓存全文

缓存时间: 2026/07/01 03:40

论文页面 - BrainJanus:脑、视觉与语言理解与生成的统一模型

来源:https://huggingface.co/papers/2606.30319 作者:

,

,

,

,

,

,

,

,

,

摘要

BrainJanus 代表了首个统一的大脑模型,通过共享的 Omni 空间整合了脑、视觉与语言,借助 token 化表示和自回归架构实现了神经活动与感官刺激之间的双向映射。

建模外部感官刺激与内部神经活动之间的双向对应关系已成为神经科学的前沿关键领域。然而,现有方法普遍将脑编码与解码视为独立任务,严重依赖单模态对齐和外部先验,忽视了大脑作为多模态整合系统的固有本质。为克服这些局限,我们提出 BrainJanus——首个在单一框架内整合脑、视觉与语言的统一大脑模型。具体而言,我们引入统一的脑 Token 化器,将连续神经动态量化为离散 Token,使其与共享 Omni 空间中的视觉和语言表示对齐。在此基础上,我们采用一体化自回归架构,利用下一 Token 预测实现无缝的任意输入到任意输出生成,涵盖图像到脑和文本到脑的编码,以及脑到图像和脑到文本的解码。大量实验表明,BrainJanus 在多种基准上均取得了优越性能。此外,我们的框架展现出零样本泛化能力,并保留了可解释的生物拓扑结构,凸显其作为通用大脑建模范式的潜力。代码可在 https://github.com/HaitaoWuTJU/BrainJanus{GitHub} 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2606.30319)查看 PDF (https://arxiv.org/pdf/2606.30319)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.30319)

在您的 agent 中获取此论文:

hf papers read 2606\.30319

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2606.30319 即可在此页面链接。

引用此论文的数据集0

无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.30319 即可在此页面链接。

引用此论文的 Spaces0

无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2606.30319 即可在此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 即可在此页面链接。

相似文章

tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face

Reddit r/LocalLLaMA

腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。