Brain-IT-VQA:从大脑信号到答案
摘要
Brain-IT-VQA 框架利用 Transformer 架构从 fMRI 信号中解码视觉内容,性能优于此前的方法。作者还引入了 NSD-VQA,这是一个新数据集,具有更丰富的标注,用于评估基于 fMRI 的视觉问答。
查看缓存全文
缓存时间: 2026/06/02 03:24
论文页面 - Brain-IT-VQA:从脑信号到答案
来源: https://huggingface.co/papers/2605.29588
摘要
Brain-IT-VQA 框架利用基于 Transformer 的架构从 fMRI 信号解码视觉内容,并引入 NSD-VQA 数据集,以改进视觉问答评估。
从人观看图像时记录的 fMRI 信号解码视觉内容,特别是回答关于所看图像的问题,是一项长期挑战。尽管近年来在基于 fMRI 的视觉问答方面取得了显著进展,但性能仍然有限。此外,虽然最近的模型能够做出越来越准确的预测,但它们很少被用作理解大脑中视觉表征结构的工具。我们提出 Brain-IT-VQA,一个基于 fMRI 进行视觉问答的框架。该方法基于 Brain Interaction Transformer,从大脑活动中解码语言标记,并将其与语言模型集成以回答视觉问题。我们的模型大幅优于此前基于 fMRI 的字幕生成和 VQA 方法。我们还引入了 NSD-VQA,这是一个用于基于 fMRI 视觉问答的新数据集和基准。与现有的图像-fMRI VQA 数据集通常每张图像仅提供少量宽泛且控制不足的问题不同,NSD-VQA 平均每张图像提供 20 个问答对,覆盖 20 个受控问题类别,这些类别解耦了多个层次的视觉理解。这使得在 fMRI 测试数据有限的情况下,仍能进行更可靠且可解释的评估。总体而言,Brain-IT-VQA 和 NSD-VQA 既提供了强大的预测框架,也提供了研究大脑表征的工具。利用这一基准,我们量化了哪些形式的视觉和语义信息能够可靠地从自然图像的 fMRI 响应中解码。我们进一步分析了不同脑区在不同问题类型中的贡献。
查看 arXiv 页面 (https://arxiv.org/abs/2605.29588) 查看 PDF (https://arxiv.org/pdf/2605.29588) 项目页面 (https://mcosarinsky.github.io/brain-it-vqa/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29588)
在你的代理中获取这篇论文:
hf papers read 2605\.29588
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2605.29588 以从本页链接。
引用该论文的数据集0
没有数据集链接到这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2605.29588 以从本页链接。
引用该论文的 Space0
没有 Space 链接到这篇论文
在 Space README.md 中引用 arxiv.org/abs/2605.29588 以从本页链接。
包含该论文的收藏0
没有收藏包含这篇论文
将这篇论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
基于视觉基础模型引导的注意力一致性纵向医学视觉问答
提出了一种用于纵向医学视觉问答的注意力引导编码器-解码器,使用冻结的基于DINO的掩码生成器和辅助损失函数来提高一致性和可解释性,在Medical-Diff-VQA基准上取得了强劲的结果。
SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准
SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。
基于证据的视频问答
本文介绍了基于证据的视频问答(E-VQA),这是一个新任务,要求模型同时输出语义答案和精确的时空证据,如跟踪对象分割掩码序列。作者创建了一个人工验证的基准数据集和一个可扩展的训练数据集,在基线方法上显示出显著改进。
自我演进的视觉提问器
本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。
DrawingVQA:一个用于建筑图纸多深度视觉-文本推理的真实世界基准
介绍了DrawingVQA,这是首个用于评估多模态大语言模型在真实建筑图纸上表现的基准,包含33张图纸和92组涵盖三种推理深度的问答对,揭示了模型与专家性能之间的差距。