思考能力:在语义fMRI神经语言解码中对Llama 3.2的基准测试及改进Huth编码模型基线
摘要
本文改进了用于fMRI解码的Huth编码流程,并介绍了fMRIFlamingo——一种基于Llama 3.2的直接fMRI到文本框架,但发现解码成功主要源于语言先验而非神经输入。
查看缓存全文
缓存时间: 2026/07/15 04:22
# 思想的能力:在语义fMRI神经语言解码中基准测试Llama 3.2并改进Huth编码模型基线 来源:https://arxiv.org/html/2607.12079 Glenn Grant-Richards UC Santa Cruz [email protected] Aidan Pinero UC Santa Cruz [email protected] ###### 摘要 从fMRI信号中解码连续语言仍然是非侵入式脑机接口研究的核心挑战。我们提出了两项互补的研究。首先,我们通过扩展体素选择(10K→15K)、用GPT-2 medium替换GPT-1作为束搜索提议模型以及GPU加速的bootstrap训练,改进了Huth等人的岭回归编码流水线,在受试者UTS03的三个保留叙事中实现了平均METEOR = 0.149和BLEU-1 = 0.200——相对于我们的复现基线,METEOR相对提升了11%。其次,我们引入了fMRIFlamingo,它将BOLD活动映射到冻结的Llama-3.2-1B模型中,通过可学习的脑分词器、Perceiver重采样器和门控交叉注意力层实现。尽管在1/100排序任务中达到了42.86%的Top-1准确率(远高于随机水平),但一项将fMRI输入置零的盲控消融实验得到了几乎相同的分数,这表明表面的解码成功主要来自冻结的语言先验,而非神经输入。这些结果表明,高容量语言模型并不会固有地改善fMRI解码,并且在缺乏严格盲控评估的情况下可能主动掩盖失败。 ## 1 引言 开发能够将连续思维解码为连续语义的非侵入式脑机接口(BCI)代表了人工智能的一个深远前沿。目标是记录功能磁共振成像(fMRI)数据(通过追踪大脑中血流变化作为神经活动的代理),并将这些空间信号转换成连贯的词元。历史上,最成功的方法采用编码模型。这涉及使用较旧、较小的语言先验(如GPT-1)训练一个模型来预测大脑对特定文本的反应,随后使用搜索算法来猜测哪句话最可能引起了观察到的脑活动。我们假设这种性能上限可能源于架构欠拟合,而非固有的生物噪声。如果一个较小的模型能取得部分成功,那么一个现代高度先进的模型(如Llama-3.2-1B或GPT-2)能否更准确地重建思维?进一步,替换编码架构以更好地处理维度坍缩是否有益于重建?我们的核心贡献是: 1. 我们实施了一个与Huth等人编码模型流水线的受控比较,包括一个在相同数据划分上评估的L2正则化岭回归基线。 2. 我们引入了fMRIFlamingo,一个直接的fMRI到语言生成框架,该框架使用可学习的分词器、Perceiver重采样器和门控交叉注意力,将原始BOLD信号映射到冻结的Llama-3.2-1B主干中,将多模态视觉-语言架构适应于神经解码。 ## 2 相关工作 我们的主要基准是Tang等人 (2023 (https://arxiv.org/html/2607.12079#bib.bib1)) 的编码到解码流水线,该流水线展示了在自然叙事聆听过程中从fMRI记录中重建连续语言。在此框架中,从GPT-1提取的上下文嵌入被用作语义特征,岭回归被训练用来预测体素级别的BOLD反应。解码随后通过搜索候选文本序列并选择预测脑活动最匹配观察信号的序列来完成。这种方法确立了高级语义信息可靠地呈现在fMRI中,并且无需侵入性记录即可重建,但它依赖于相对较小的语言模型和通过编码模型的间接解码。 后续工作探索了现代大语言模型是否为神经解码提供了更好的语义表示。Tang等人 (2025 (https://arxiv.org/html/2607.12079#bib.bib4)) 的更新流水线表明,来自当代Transformer的语言模型特征与脑活动强烈对齐,并引入了跨受试者功能对齐以提高受试者间的泛化能力。类似地,Sato和Kobayashi (2025 (https://arxiv.org/html/2607.12079#bib.bib5)) 表明,来自Llama-3和OPT等近期LLM的隐藏状态可以高精度预测神经反应,表明现代语言模型捕捉到了与皮层中表示的语义结构相似的语义。 最近的研究也开始探索多模态和时间序列架构,这些架构实现了神经数据与大型预训练模型之间更紧密的集成。诸如OpenTSLM Langer等人 (2026 (https://arxiv.org/html/2607.12079#bib.bib11)) 的框架将基于Transformer的推理扩展到结构化时间信号,使大语言模型能够同时处理多变量时间序列输入和文本。参数高效适应方法如QLoRA Dettmers等人 (2023 (https://arxiv.org/html/2607.12079#bib.bib7)) 进一步使得将大型冻结主干与小型特定领域数据集结合成为可能。这些发展共同使得考虑脑信号与LLM潜在空间之间的直接对齐成为可能,而不仅仅依赖线性编码模型。 与先前主要将语言模型用作特征提取器的工作不同,我们的方法研究是否可以使用多模态架构将冻结的LLM直接基于fMRI输入进行条件化。这种设置提出了新的评估挑战,因为强大的语言先验即使在未使用神经输入时也能产生流畅的输出,这要求在将大语言模型应用于神经解码时进行严格的对照实验。 ## 3 方法 为了确保公平比较,我们在相同标准化数据集上评估两种不同的架构。 ### 3.1 数据集与预处理约束 我们按照Tang等人 (2023 (https://arxiv.org/html/2607.12079#bib.bib1)) 的实验设置,使用了一个叙事聆听fMRI数据集。该数据集包含约16小时的自然语音聆听,来自8名受试者多个会话的记录。每个fMRI体积在体素选择前包含大约10^5个体素,而BOLD反应每2秒采样一次(TR≈2 s),导致经典的样本少、维度高的学习问题。由于个体间的解剖结构和功能反应差异很大,所有模型均针对每个受试者使用故事级别的训练/测试划分进行单独训练和评估。我们的训练/测试划分与原始实验不同。 ### 3.2 基线:岭回归流水线 我们实现了基线编码模型作为我们的经验下限。使用5个上下文单词从GPT-1模型的第9层提取文本特征。为了处理大脑中血流(血液动力学反应)的延迟特性,我们应用Lanczos 2D插值进行时间对齐,同时使用有限冲激响应(FIR)延迟。我们通过15次迭代的bootstrap相关性分离出信息最丰富的10,000个体素。从文本特征到这些体素的映射通过L2正则化岭回归学习。用非技术术语来说,由于许多相邻脑体素表现出高度相关的活动,标准回归会产生不稳定、剧烈波动的预测。岭回归应用数学惩罚来收缩这些权重,将预测能力安全地分布在相关变量之间。最后,通过束搜索执行解码,根据拟合的噪声模型和语言先验对候选句子进行评分。 ### 3.3 对Huth基线的改进 受初始复现分数与Huth等人报告的自有测试故事分数之间差距的驱动,我们对岭回归流水线引入了三项针对性改进。每项改进旨在增加编码模型的判别能力或提供给束搜索的候选词质量,而不改变核心架构。 **扩展体素选择 (10K→15K)**。Huth等人通过bootstrap相关性选择前10,000个体素。我们将体素超参数提高到15,000,保持bootstrap所有其他方面不变。直觉是额外5,000个体素携带来自更广泛皮层区域(如额下回、颞下回)的信号,这些区域已知参与语义处理。所有三名受试者的bootstrap相关性均有可测量的改善:使用15K模型,UTS03的平均前100 bootstrap相关性达到0.340,而使用10K选择的值更低。 **GPT-2 Medium 提议语言模型**。在Huth束搜索解码器中,每一步语言模型提议一个候选下一个词的核心集合,然后由编码模型重新排序。原始实现使用GPT-1(1.17亿参数,2018年)用于此目的。我们将**提议**语言模型替换为GPT-2 medium(3.45亿参数),同时严格保留GPT-1用于编码模型特征。这设计上是安全的:只有GPT-1的第9层嵌入用于训练岭权重;GPT-2仅在解码时用来生成语法质量更高的候选词。一个关键技术挑战是GPT-2的字节对编码(BPE)词汇表:大多数完整单词被拆分为2个或更多子词单元(例如,“recovery”→ [Ġrec, overy]),导致简单的单词元查找对于约70%的4,668词解码器词汇表失败。我们通过一种贪婪的**第一子词代理**方法解决了这个问题:对于每个解码器词汇单词,我们在GPT-2词汇表中找到最长的以Ġ为前缀且是该单词前缀的词元,并使用其概率作为该单词的近似。这种方法实现了100%的解码器词汇表覆盖(4,368个单词元精确匹配 + 300个代理近似),而朴素方法几乎为零覆盖。 **GPU加速训练(PyTorch岭回归)**。原始bootstrap岭回归完全在CPU上使用NumPy运行,每次受试者进行15次bootstrap迭代大约需要60分钟。我们进一步将20次bootstrap迭代拆分到两个GPU上,使用基于spawn的Python多进程池,实现了10倍的墙钟时间加速。所有三名受试者并行在六块NVIDIA RTX 3090 GPU上重新训练(每名受试者两块),总训练时间从约3小时减少到约15分钟(不包括CPU噪声模型阶段)。 表1:Huth编码模型基线改进的消融实验(UTS03,感知语音,3个保留测试叙事)。15K体素 + GPT-2 medium配置平均METEOR = 0.144,BLEU-1 = 0.195,BERTScore = 0.813,显著高于我们的10K体素复现。BERTScore使用RoBERTa-large召回率,未使用IDF重新加权。使用每个故事的最优配置(quietfire使用单独的15K;其他两个故事使用15K+GPT-2)平均METEOR = 0.149,BERT = 0.814。每个故事的最佳结果以**粗体**标出。Huth等人原始的BERT分数(约0.81)来自他们在“Where There’s Smoke”上报告的结果;我们的测试故事是不同的叙事,因此直接数值比较是近似的。 ### 3.4 我们的模型:fMRIFlamingo fMRIFlamingo并不试图从文本预测脑活动,而是尝试相反的过程:将fMRI直接映射到文本生成。该架构将OpenFlamingo多模态框架 (Awadalla等人, 2023 (https://arxiv.org/html/2607.12079#bib.bib8)) 适应到fMRI领域。 1. **fMRITokenizer(脑分词器)**:原始fMRI体积形状为 `(体素 × TR)` 首先通过确定性解剖分配(固定随机排列,种子42,轮流块分配)分组为 `N_ROI` 个感兴趣区域(ROI)。每个ROI是其分配体素的平均值,产生一个空间压缩表示,形状为 `(N_ROI, TR)`,我们设 `N_ROI = 2,000`,相对于10K体素选择将输入维度降低了5倍,使得在单个16GB显存GPU上训练可行。一个可学习的 `Linear(TR, d_inner)` 投影然后将每个ROI的完整时间轮廓映射到内部维度,随后是可学习的位置嵌入、LayerNorm和dropout。此设计特意保留了完整的时间轮廓,而不是将其坍缩为标量均值,从而保留了血液动力学反应的时间结构。**逐ROI**归一化被禁用,因为Huth数据集已经全局Z评分。 2. **Perceiver重采样器**:ROI词元序列 `(N_ROI × d_inner)` 通过Perceiver重采样器 (Jaegle等人, 2022 (https://arxiv.org/html/2607.12079#bib.bib9)) 压缩为固定数量的潜在向量 `(N_latent × d_LM)`,匹配Llama-3.2-1B的隐藏维度。这为LLM提供了一个固定长度的接口,与fMRI分辨率无关。 3. **门控交叉注意力进入冻结的Llama-3.2-1B**:Llama-3.2-1B (Touvron等人, 2023 (https://arxiv.org/html/2607.12079#bib.bib10)) 的权重完全冻结。新初始化的**门控交叉注意力**层每N个解码器层插入一个。每个层门的初始化使得 `tanh(gate) = 0.5`,确保视觉通路从第一步训练开始就是活跃的(默认Flamingo门为0,这会在初始化时给出零信号)。LM接收潜在脑词元作为键和值;门参数被训练以学习脑驱动注意力和文本驱动注意力之间的最优混合比例。可训练参数包括:fMRITokenizer、Perceiver、门控交叉注意力层和输入嵌入。 4. **缓解后验坍缩(文本掩码)**:现代LLM高度优化用于文本。如果它们能仅凭文本上下文预测下一个词,它们会完全忽略嘈杂的fMRI数据(后验坍缩)。为了强制模型依赖脑信号,训练期间50%的输入提示词元被替换为 `<mask>` 词元,相应的注意力掩码位置被置零。 5. **优化**:网络使用下一个词元预测(每个2秒TR窗口预测1个新词元)的交叉熵损失进行优化。对比排序损失 `L_rank` 应用log-sum-exp函数,在正确目标序列与从滚动缓冲区(最近看到的500个训练目标)中随机采样的干扰项之间进行对比,鼓励正确下一个词排序更高。在推理时,我们使用**直接解码**:对于每个fMRI窗口,模型以fMRI信号和少量前文词元为条件,自回归地生成下一个词,使用3束搜索,`max_new_tokens=1`。这与Huth流水线的连续束搜索叙事解码和标准Flamingo的完整序列束搜索都不同;每个2秒TR窗口被独立解码,每个窗口产生一个预测词。逐窗口解码任务(每个窗口一个预测词)
相似文章
Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码
研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。
我测试了 llama.cpp 在 Qwen 3.6 27B 上的所有推测性解码方法:MTP ~2.7x, DFlash ~3.7x, n-gram 堆叠在真实编码中达到 ~6x。本地 AI 获胜。我在 RTX 6000 PRO 上的发现。
llama.cpp 在 Qwen 3.6 27B 上的推测性解码方法的全面基准测试表明,在 DFlash 上叠加 n-gram 堆叠在迭代编码任务中实现了高达 6 倍的加速,其中 ngram-mod 贡献了大部分增益且零 VRAM 成本。
基于混合分析与机器学习预测器的大语言模型推理延迟与能耗多级建模
本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。
跨语言模型架构的神经激活模式:认知任务性能的综合分析
本文分析了六种LLM架构在认知任务上的神经激活模式,揭示了编码器和解码器模型在注意力熵和稀疏性上的差异。
LiquidAI/LFM2.5-ColBERT-350M
LiquidAI 发布 LFM2.5-ColBERT-350M,这是一种后期交互多语言检索模型,同时还有一个密集双编码器变体,两者均基于 LFM2.5-350M-Base,支持 11 种语言,并设计为 RAG 管道的即插即用替代品。