BrainJanus:一个统一的大脑、视觉与语言理解与生成模型
摘要
BrainJanus是首个统一的大脑模型,通过共享的Omni空间整合大脑、视觉与语言,利用分词表征和自回归下一个token预测实现神经活动与感官刺激的双向映射。
查看缓存全文
缓存时间: 2026/07/01 03:40
论文页面 - BrainJanus:脑、视觉与语言理解与生成的统一模型
来源:https://huggingface.co/papers/2606.30319 作者:
,
,
,
,
,
,
,
,
,
摘要
BrainJanus 代表了首个统一的大脑模型,通过共享的 Omni 空间整合了脑、视觉与语言,借助 token 化表示和自回归架构实现了神经活动与感官刺激之间的双向映射。
建模外部感官刺激与内部神经活动之间的双向对应关系已成为神经科学的前沿关键领域。然而,现有方法普遍将脑编码与解码视为独立任务,严重依赖单模态对齐和外部先验,忽视了大脑作为多模态整合系统的固有本质。为克服这些局限,我们提出 BrainJanus——首个在单一框架内整合脑、视觉与语言的统一大脑模型。具体而言,我们引入统一的脑 Token 化器,将连续神经动态量化为离散 Token,使其与共享 Omni 空间中的视觉和语言表示对齐。在此基础上,我们采用一体化自回归架构,利用下一 Token 预测实现无缝的任意输入到任意输出生成,涵盖图像到脑和文本到脑的编码,以及脑到图像和脑到文本的解码。大量实验表明,BrainJanus 在多种基准上均取得了优越性能。此外,我们的框架展现出零样本泛化能力,并保留了可解释的生物拓扑结构,凸显其作为通用大脑建模范式的潜力。代码可在 https://github.com/HaitaoWuTJU/BrainJanus{GitHub} 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2606.30319)查看 PDF (https://arxiv.org/pdf/2606.30319)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.30319)
在您的 agent 中获取此论文:
hf papers read 2606\.30319
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2606.30319 即可在此页面链接。
引用此论文的数据集0
无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.30319 即可在此页面链接。
引用此论文的 Spaces0
无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.30319 即可在此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 即可在此页面链接。
相似文章
RxBrain:具有联合语言-视觉推理与想象力的具身认知基础模型
RxBrain是一个具身认知基础模型,它通过语言和视觉想象联合推理来表征具身规划,采用统一的多模态混合Transformer架构。无需大规模动作数据即可在真实机器人上取得良好表现。
tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face
腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。
@FutureJurvetson: 这在我的J-Space中深入展开。我一直对可解释性研究能否取得成果持怀疑态度,但这次更新确实……
Anthropic的新研究揭示了语言模型中的全局工作空间,展示了人脑中的意识与潜意识划分与Claude的内部推理之间存在惊人的相似性。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。
@hillbig: 大型语言模型被认为不仅预测下一个token,还会在内部维持中间概念……
本文引入雅可比透镜(J-lens)和J-空间,表明像Claude Sonnet 4.5这样的LLM维护着可语言化的内部表征,这些表征像一个全局工作空间,因果性地用于灵活推理——通过干预实验进行了验证。