Brain-IT-VQA:从大脑信号到答案

Hugging Face Daily Papers 论文

摘要

Brain-IT-VQA 框架利用 Transformer 架构从 fMRI 信号中解码视觉内容,性能优于此前的方法。作者还引入了 NSD-VQA,这是一个新数据集,具有更丰富的标注,用于评估基于 fMRI 的视觉问答。

从人观看图像时记录的 fMRI 信号中解码视觉内容,并回答关于所看到图像的具体问题,是一项长期挑战。尽管近年来基于 fMRI 的视觉问答(VQA)取得了显著进展,但性能仍然有限。此外,尽管最近的模型能够做出越来越准确的预测,但它们很少被用作理解大脑中视觉表征结构的工具。我们提出了 Brain-IT-VQA,这是一个基于 fMRI 进行视觉问答的框架。我们的方法以 Brain Interaction Transformer (Brain-IT) 为基础,从大脑活动中解码语言标记,并将其与语言模型集成以回答视觉问题。我们的模型显著优于之前基于 fMRI 的标注和 VQA 方法。我们进一步引入了 NSD-VQA,这是一个用于基于 fMRI 的视觉问答的新数据集和基准。与现有的图像-fMRI VQA 数据集(通常每张图像仅提供少数几个宽泛且控制薄弱的问答)不同,NSD-VQA 在 20 个受控问题类别下,每张图像平均提供 20 个问答对,这些类别区分了多个层次的视觉理解。这使得在有限的 fMRI 测试数据下也能进行更可靠和可解释的评估。Brain-IT-VQA 和 NSD-VQA 共同提供了一个强大的预测框架以及研究大脑表征的工具。利用这一基准,我们量化了从自然图像 fMRI 响应中可可靠解码的视觉和语义信息形式。我们还分析了不同问题类型下不同脑区的贡献。
查看原文
查看缓存全文

缓存时间: 2026/06/02 03:24

论文页面 - Brain-IT-VQA:从脑信号到答案

来源: https://huggingface.co/papers/2605.29588

摘要

Brain-IT-VQA 框架利用基于 Transformer 的架构从 fMRI 信号解码视觉内容,并引入 NSD-VQA 数据集,以改进视觉问答评估。

从人观看图像时记录的 fMRI 信号解码视觉内容,特别是回答关于所看图像的问题,是一项长期挑战。尽管近年来在基于 fMRI 的视觉问答方面取得了显著进展,但性能仍然有限。此外,虽然最近的模型能够做出越来越准确的预测,但它们很少被用作理解大脑中视觉表征结构的工具。我们提出 Brain-IT-VQA,一个基于 fMRI 进行视觉问答的框架。该方法基于 Brain Interaction Transformer,从大脑活动中解码语言标记,并将其与语言模型集成以回答视觉问题。我们的模型大幅优于此前基于 fMRI 的字幕生成和 VQA 方法。我们还引入了 NSD-VQA,这是一个用于基于 fMRI 视觉问答的新数据集和基准。与现有的图像-fMRI VQA 数据集通常每张图像仅提供少量宽泛且控制不足的问题不同,NSD-VQA 平均每张图像提供 20 个问答对,覆盖 20 个受控问题类别,这些类别解耦了多个层次的视觉理解。这使得在 fMRI 测试数据有限的情况下,仍能进行更可靠且可解释的评估。总体而言,Brain-IT-VQA 和 NSD-VQA 既提供了强大的预测框架,也提供了研究大脑表征的工具。利用这一基准,我们量化了哪些形式的视觉和语义信息能够可靠地从自然图像的 fMRI 响应中解码。我们进一步分析了不同脑区在不同问题类型中的贡献。

查看 arXiv 页面 (https://arxiv.org/abs/2605.29588) 查看 PDF (https://arxiv.org/pdf/2605.29588) 项目页面 (https://mcosarinsky.github.io/brain-it-vqa/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29588)

在你的代理中获取这篇论文:

hf papers read 2605\.29588

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接到这篇论文

在模型 README.md 中引用 arxiv.org/abs/2605.29588 以从本页链接。

引用该论文的数据集0

没有数据集链接到这篇论文

在数据集 README.md 中引用 arxiv.org/abs/2605.29588 以从本页链接。

引用该论文的 Space0

没有 Space 链接到这篇论文

在 Space README.md 中引用 arxiv.org/abs/2605.29588 以从本页链接。

包含该论文的收藏0

没有收藏包含这篇论文

将这篇论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准

Hugging Face Daily Papers

SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。

基于证据的视频问答

Hugging Face Daily Papers

本文介绍了基于证据的视频问答(E-VQA),这是一个新任务,要求模型同时输出语义答案和精确的时空证据,如跟踪对象分割掩码序列。作者创建了一个人工验证的基准数据集和一个可扩展的训练数据集,在基线方法上显示出显著改进。

自我演进的视觉提问器

Hugging Face Daily Papers

本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。