音素与字符级目标及选择性状态空间模型在皮层内脑到文本中的应用

arXiv cs.CL 论文

摘要

本文研究了音素与字符目标以及选择性状态空间模型(Mamba)对皮层内脑到文本解码的影响,发现基于GRU的循环解码器在Brain-to-Text '25基准测试中仍是表现最强的模型。

arXiv:2607.26751v1 公告类型:新 摘要:最先进的皮层内脑到文本系统将神经序列音素解码器与外部语言模型配对。有两个设计方向尚未充分探索:选择性状态空间模型(Mamba)是否优于循环解码器,以及输出目标(音素 vs 字符)如何与该选择相互作用。在公开的Brain-to-Text '25基准测试中,我们在一个可重复的实验协议下,采用CTC目标函数训练了一个受控的2x2网格(GRU vs 混合Mamba解码器;音素 vs 字符目标)。循环基线仍然是最强的:最佳音素GRU达到12.62%的音素错误率(PER)和21.19%的词错误率(WER),而经过语言模型重打分后的最佳文本GRU达到13.39%的字符错误率(CER)和26.28%的WER。混合Mamba模型具有竞争力但未超越它。消融实验分离了架构贡献,错误分析显示了依赖表示的错误类型:类似发音的音素混淆与词汇及词边界错误。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 音素级与字符级目标及选择性状态空间模型在皮层内脑到文本解码中的应用
来源: https://arxiv.org/html/2607.26751
Zamora Vera Gonzalez\-Lopez

Jose A1加泰罗尼亚开放大学 (UOC), 西班牙 2信号理论、远程信息处理与通信系, 格拉纳达大学, 西班牙 3信息与通信技术研究中心 (CITIC\-UGR), 格拉纳达大学, 西班牙lzamorav@uoc\.edu, joseangl@ugr\.es (https://arxiv.org/html/2607.26751v1/mailto:[email protected],%[email protected])

###### 摘要

最先进的皮层内脑到文本系统将神经序列音素解码器与外部语言模型配对。有两个设计轴尚未充分探索:选择性状态空间模型 (Mamba) 是否能改善循环解码器,以及输出目标 (音素 vs. 字符) 如何与该选择相互作用。在公开的 Brain\-to\-Text '25 基准测试中,我们研究了一个受控的 2x2 网格 (GRU vs. 混合 Mamba 解码器;音素 vs. 字符目标),在单一可复现协议下使用 CTC 目标进行训练。循环基线仍然最强:最佳音素 GRU 达到 12.62% 的 PER 和 21.19% 的 WER,而经过 LM 重评分后的最佳文本 GRU 达到 13.39% 的 CER 和 26.28% 的 WER。Mamba 混合体具有竞争力,但并未超越它。消融实验分离了架构贡献,错误分析显示依赖于表示的失败模式:类似发音的音素混淆 vs. 词汇和词边界错误。

###### 关键词:

脑机接口,言语神经假体,皮层内言语解码,状态空间模型,脑到文本

## 1 引言

患有肌萎缩侧索硬化症 (ALS)、脑干卒中或闭锁综合征的人可能会失去清晰的言语能力,同时保留认知功能,而恢复可靠的通信通道可显著改善自主性和社会参与度 [silva2024speech, wolpaw2002bci, chang2024restoring]。脑机接口 (BCI) 旨在通过将神经活动转化为通信输出来恢复这一通道 [wolpaw2002bci],该范式最初是为瘫痪患者的运动和光标控制而建立的 [hochberg2012reach, pandarinath2017high, vansteensel2016fully]。言语解码已在多种记录模态下进行探索:非侵入式记录支持粗略的感知解码 [tang2023semantic, defossez2023decoding],皮层脑电图 (ECoG) 能够实现短语和句子级别的解码与合成 [herff2015braintotext, makin2020machine, anumanchipalli2019synthesis, angrick2019synthesis, martin2014decoding],而皮层内微电极阵列则提供最高的时空分辨率,驱动了最精确的近期言语解码器 [silva2024speech, willett2023high, card2024accurate]。其神经功能基础在于,即使在运动输出丧失的情况下,腹侧感觉运动皮层仍保留丰富的发音信息 [silva2024speech, hickok2007cortical, pulvermuller2018neural]。

脑到文本系统将言语解码视为一个序列到序列问题,多通道神经信号与目标符号序列之间没有明确的对应关系,这自然由连接主义时序分类 (CTC) 目标来处理 [graves2006ctc]。主流范式是两阶段的:一个循环解码器将神经活动映射到亚词汇单元 (通常是音素),然后一个语言模型 (LM) 重建最可能的句子 [willett2023high, card2024accurate, silva2024speech, brumberg2010bci]。标志性的皮层内结果,包括高速手写解码 [willett2021handwriting]、失语症患者的实时解码 [moses2021neuroprosthesis]、大词汇量言语神经假体 [willett2023high]、高性能虚拟形象与语音系统 [metzger2023avatar]、可泛化的拼写 [metzger2022spelling]、即时语音合成 [wairagkar2025voice],以及一个在长时间使用中达到低于 5% 词错误率的快速校准系统 [card2024accurate],确立了这一研究方向在临床上的相关性,其精度正接近现代自动语音识别 (ASR) 系统 [baevski2020wav2vec, radford2023whisper]。最近的 Brain\-to\-Text '24 基准测试报告指出,解码性能的最大提升来自于更好的训练、集成和 LM 重评分,而非替换循环解码骨干网络,而 Transformer 并未显示出明显优势 [willett2024benchmark, li2024context]。

然而,有两个设计选择相对研究不足。首先,选择性状态空间模型 (SSM),特别是 Mamba [gu2023mamba],提供了一种具有输入相关选择性的线性时间循环公式,这对于长且嘈杂的神经序列具有吸引力。SSM 在 ASR 中已展现出潜力,既作为独立的语音编码器 [miyazaki2024mamba, jiang2024slytherin],也以卷积增强的形式 [hou2024conmamba, zevallos2025mamba] 呼应了基于注意力的序列模型 [vaswani2017attention, chan2016listen]、Conformer [gulati2020conformer] 及其高效变体 [burchi2021efficient, peng2022branchformer] 的成功。它们是否有助于皮层内解码仍是一个开放问题。其次,大多数系统采用音素目标,而直接的字符级目标则消除了对发音词典的依赖,使解码器更接近最终输出。最近一项在相同数据集上进行的端到端字符级 Conformer 研究表明,无需外部语言模型即可实现有意义的直接字符解码,但也发现主要错误源于不正确的词边界分割 [khanday2026endtoend]。然而,将目标表示与解码器架构交叉进行受控比较仍然缺失。

本文提出以下问题:选择性状态空间模型是否能改善皮层内脑到文本的循环解码器?输出目标 (音素 vs. 字符) 如何与该选择相互作用?我们做出三项贡献:(i) 在公开的 Brain\-to\-Text '25 基准测试上,采用单一可复现的 CTC 流程进行受控的 2×2 研究 (GRU vs. 混合 ConvMambaGRU;音素 vs. 文本目标);(ii) 据我们所知,首次将 ConvMamba 风格骨干网络适配到皮层内脑到文本,并通过消融实验分离其卷积前端和循环改进阶段的作用;(iii) 一种基于表示的错误分析,对比音素级别和字符级别的失败模式。我们的发现是,循环基线仍然是最强的解码器,而音素两阶段变体产生了最低的 WER;SSM 混合体具有竞争力但并未超越它,这与单参与者皮层内解码的数据有限机制一致 [willett2024benchmark]。

## 2 方法

### 2.1 通用流程

图 1 (https://arxiv.org/html/2607.26751#S2.F1) 总结了所有配置共享的流程。一个皮层内神经特征试次首先通过一个每会话适配层,该层会标准化日常分布漂移,然后通过时间分块以缩短有效序列。一个序列核心 (循环基线或状态空间变体之一) 产生输出词汇表上每个时间步的分布,并端到端地使用 CTC 目标进行训练 [graves2006ctc]。我们研究的两个设计轴位于该核心的两端:目标表示 (音素 vs. 字符),它设定了输出词汇表;以及序列骨干网络。最后的语言解码阶段 (贪心或束搜索) 可选地由语言模型进行重评分,将逻辑值转换为输出句子;在音素分支中,该阶段还执行音素到文本的转换。除骨干网络和目标外,保持每个阶段固定,让我们能够将差异归因于这两个因素。

参见图注图 1:实验流程概览。皮层内神经活动经过预处理后传递给神经解码器。我们研究两个因素:序列骨干网络 (GRU、Mamba 变体和 ConvMambaGRU) 以及目标表示 (音素 vs. 文本)。得到的序列使用 CTC 进行解码,并可选地通过束搜索和语言模型重评分进行优化,以获得最终的句子级转录。

### 2.2 数据集与信号处理

我们使用公开的 Brain\-to\-Text '25 基准测试,该测试随 Card 等人的言语神经假体 [card2024accurate] 发布,并用于 Brain\-to\-Text 基准测试系列工作 [willett2024benchmark]。数据来自一名患有 ALS、重度构音障碍和四肢轻瘫但认知功能完好的参与者,其左侧腹侧中央前回植入有四个 64 通道微电极阵列 (总共 256 个皮层内电极) [card2024accurate]。每个试次是一个带对齐转录文本的提示言语尝试,编码为一个可变长度矩阵 X ∈ R^(T×512),其中 T 是 20 毫秒时间仓的数量,512 个特征是每个电极的两个测量值 (分仓阈值交叉计数和 spike 频带功率)。我们使用官方划分:8,072 个训练试次和 1,426 个验证试次;1,450 个测试试次因其转录文本未公开而被排除,因此所有比较均在验证集上进行。

信号处理遵循基线流程:高斯时间平滑和每会话标准化,后者减少了因电极漂移和阻抗变化引起的会话间分布漂移,这是慢性记录中一个已有充分记录的非平稳性来源 [simeral2011neural, gallego2017neural],先前的工作通过重新校准 [jarosiewicz2015virtual] 和流形对齐 [degenhart2020stabilization] 解决了这个问题。仅在训练期间,我们应用轻量级的 SpecAugment 风格增强 [park2019specaugment] 作为正则化:每通道增益、白噪声、恒定偏移、随机游走噪声和随机起始裁剪。

### 2.3 问题形式化

给定试次表示 X ∈ R^(T×512),解码器在音素或字符的输出词汇表上发射一序列每帧逻辑值。由于 X 与目标 y 之间没有明确对齐,我们使用 CTC 进行训练 [graves2006ctc]:给定 X 下 y 的概率是折叠为 y 的所有对齐方式 π 之和,P(y | X) = Σ_(π ∈ B^(-1)(y)) P(π | X),损失为 L_CTC = -log P(y | X)。推理时,CTC 折叠会移除空白和连续重复。可变长度试次通过零填充进行批处理,同时保留真实长度,因此填充不影响损失。

### 2.4 解码器架构

所有骨干网络共享第 2.1 节中的流程 (每会话适配、时间分块、序列核心、线性投影),因此性能差异可归因于核心和目标表示。

**GRU 基线。** 一个可复现的循环解码器,与最近的脑到文本系统一致:一个每会话适配层、用于缩短有效序列的时间分块、一个单向 GRU 层堆栈 [cho2014gru] 以及一个最终投影。

**状态空间模型。** 作为替代核心,我们考虑 Mamba [gu2023mamba],一种选择性状态空间模型 (SSM)。一个连续 SSM 通过潜在状态 h(t) 将输入信号 x(t) 映射到输出 y(t):

h′(t) = A h(t) + B x(t),
y(t) = C h(t),   (1)

其中 A 控制内部状态动态,B 控制输入如何驱动状态,C 控制状态如何被读出。在时间上离散化得到线性递归:

h_t = \bar{A}_t h_{t-1} + \bar{B}_t x_t,
y_t = C_t h_t,   (2)

其计算量与序列长度成线性关系,区别于自注意力的二次代价,这使得它对于这里的长且嘈杂的神经序列具有吸引力。Mamba 的关键思想是选择性:参数 (\bar{B}_t, C_t) 和离散化步长成为当前输入的函数,因此模型可以选择在每个时间步保留、更新或丢弃哪些信息 [gu2023mamba]。这种依赖输入的选通机制非常适合神经记录,因为并非每个时间仓都同样信息丰富。

在此核心之上,我们评估三种日益结构化的变体。(i) **Mamba** 在分块后直接应用残差 Mamba 模块,仅分离 SSM 核心的贡献 [gu2023mamba, miyazaki2024mamba]。(ii) **ConvMamba** 在 Mamba 模块之前添加一个残差 Conv1D 前端。其动机是,借鉴卷积增强的 SSM (它们用 Mamba 层替代 Conformer 自注意力 [hou2024conmamba, zevallos2025mamba]),局部深度可分离卷积能有效捕捉短程的类似发音的模式,补充 SSM 建模的长程依赖关系,这在训练数据稀缺时尤其有用 [jiang2024slytherin]。(iii) **ConvMambaGRU**,我们提出的变体,在 Mamba 模块之后、投影之前添加一个最终单向 GRU 作为时间改进阶段,结合了局部卷积上下文、线性时间选择性状态空间建模和循环改进。时间分块本身遵循视觉 Transformer 中基于分块的词元化 [dosovitskiy2021image],在保留局部上下文的同时缩短序列长度。

每个骨干网络都实例化为**音素**变体 (ARPAbet 目标,之后由 LM 阶段转换为文本) 和**文本**变体 (字符目标,直接解码)。表 1 总结了这些配置。

表 1:评估的骨干网络,实例化为音素 (P) 和文本 (T) 变体。输出类别包括 CTC 空白符。

### 2.5 语言解码与重评分

从 T×P 逻辑值矩阵中,我们通过贪心 CTC 解码和束搜索获得假设。在束搜索假设上,我们应用 LM 重评分:最终得分结合神经 (CTC) 得分和 LM 合理性,Score(y) = Score_CTC(y) + α * Score_LM(y),其中 α 权衡语言成分。在音素变体中,LM 至关重要,因为它执行音素到文本的转换;在文本变体中,它优化一个已经是字符级别的假设。我们比较一个通用 Transformer LM (GPT\-2 变体 [radford2019gpt2]) 和一个在领域上训练的 n\-gram LM (KenLM [heafield2011kenlm])。对于文本解码,我们使用 CTC 束搜索,束宽为 100,并保留前 100 个假设用于 LM 重评分。对于每个解码器–LM 对,根据最低 WER 在验证集上选择 LM 权重 α。

## 3 实验设置

数据集、划分和信号处理在第 2.2 节中描述;所有结果均在包含 1,426 个试次的验证集上报告。

**指标。** 音素错误率 (PER) 用于音素解码器;最终文本使用字符错误率 (CER) 和词错误率 (WER) 来评估所提出的系统。

**实现。** 模型使用 PyTorch 实现,并在单个 NVIDIA 3060 GPU (12 GB VRAM) 上训练。为了可复现性,每次运行都保留配置文件、检查点、验证预测和指标日志。每个实验都固定随机种子。代码和训练好的模型工件将在论文最终版本发布时公开。

相似文章

从神经活动进行端到端的大脑皮层内语音解码

arXiv cs.CL

本文提出了一种端到端的基于Conformer的神经解码器,用于从一位肌萎缩侧索硬化症(ALS)参与者的皮层内记录进行语音解码,在没有任何外部语言模型的情况下,字符错误率达到23.80%。该研究表明,在完全端到端的框架中实现有意义的字符级解码是可行的。

Brain-CLIPLM:基于脑电压缩语义表征的语言重建解码

arXiv cs.CL

研究人员提出Brain-CLIPLM,一个两阶段脑电到文本解码框架,利用对比学习提取语义锚点,并结合基于检索的大语言模型(LLM)及思维链(CoT)推理进行句子重建。该方法在测试中达到67.55%的Top-5句子检索准确率和85.00%的Top-25准确率,显著优于直接解码基线模型,跨被试评估证实了其良好的泛化能力。研究结果表明,脑电到文本解码应聚焦于恢复压缩后的语义内容,而非完整句子重建。

Brain Score 追踪语言的共享属性:来自多种自然语言和结构序列的证据

arXiv cs.CL

本文研究了 Brain Score(一个将语言模型表征与人类阅读时 fMRI 激活进行比较的指标)是否真正捕捉到类似人类的语言处理,或仅反映结构相似性。研究人员在多种自然语言和非语言结构数据(基因组、Python、嵌套括号)上训练语言模型,发现在不同语言和非语言序列上训练的模型达到相似的 Brain Score 性能,这表明该指标可能不足以区分人类特有的处理方式。