面向代理式语音识别的Voice Memory
摘要
Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。
arXiv:2607.26410v1 Announce Type: new
摘要:我们提出Voice Memory,一种用于代理式语音识别的仅推理方案:在流式处理时,一个冻结的纠正器读取单个领域记忆文件memory.md,并为每个话语决定是采纳假设还是放弃并保留最佳结果。异步地,一个分数门控优化器通过有界编辑来修订该文件,仅当编辑严格改进保留分数时才接受。此方法源自经典ASR-LM框架,我们将这种分离称为倾听-思考架构;两个角色仅通过记忆耦合,因此权重不变,所学技能保持可审计和可移植。约束是这个循环发现的运作技能:无约束的生成式纠错(GER)会过度纠正,在金融新闻中多达64%的编辑破坏了正确的词元,而Voice Memory将此比例降至35%。在十个HyPoradise领域中,使用开放纠正器时,Voice Memory将加权词错误率从8.36%降至7.52%(添加三个上下文示例后为7.47%),且未使任何数据集退化到低于其最佳基线;收益集中在可恢复余量最大的地方,包括航空旅行命令(从8.40%降至3.40%)和嘈杂的远场语音(CHiME-4,从12.69%降至10.46%)。该记忆可跨纠正器家族迁移,且不向推理路径增加任何参数。提供了演示和示例代码以供未来研究。
查看缓存全文
缓存时间: 2026/07/30 09:57
# 面向智能体语音识别的语音记忆
来源:https://arxiv.org/html/2607.26410
Chao\-Han Huck Yang∗Zih\-Ching Chen Piotr Żelasko Zhehuai Chen Jagadeesh Balam Boris Ginsburg NVIDIA 通讯邮箱:huckiyang@ieee\.org\{virginiac, pzelasko, zhehuaic\}@nvidia\.com ∗工作完成于NVIDIA。模型 (https://huggingface.co/huckiyang/voice-memory) 演示 (https://huckiyang.github.io/voice-memory/) NeMo\-Speech (https://github.com/NVIDIA-NeMo/Speech) NeMoClaw (https://github.com/NVIDIA/NemoClaw) 笔记本 (https://huckiyang.github.io/voice-memory-notebook)
###### 摘要
摘要我们提出Voice Memory,一种仅用于推理的智能体语音识别方案:在流式处理时,一个冻结的纠错器读取单个领域特定的memory\.md,并逐句决定是**执行**假设还是**放弃**并保留1-best结果。异步地,一个基于分数门控的优化器通过有界编辑修订该文件,只有当编辑严格提升保留分数时才接受该编辑。从经典的ASR-LM框架扩展而来,我们将这种分离称为**监听者-思考者**架构;两种角色仅通过记忆耦合,因此无需更改权重,学习到的技能保持可审计和可移植。事实证明,抑制是这个循环发现的关键操作技能:无约束的生成式纠错(GER)会过度纠正,在财经新闻中高达64%的编辑会破坏正确的token,而Voice Memory将此比率降至35%。在十个HyPoradise领域中使用开放纠错器,Voice Memory将加权词错误率从8.36%降至7.52%(加入三个上下文示例后降至7.47%),且未使任何数据集低于其1-best基线;收益集中在可恢复空间最大的领域,包括航空旅行命令(从8.40%降至3.40%)和嘈杂远场语音(CHiME-4,从12.69%降至10.46%)。该记忆可跨纠错器家族迁移,且推理路径上无需增加任何参数。提供了演示和示例代码供未来研究。
###### 关键词:
语音智能体,记忆建模,设备端,语言模型,测试时自适应
## 1 引言
现代语音系统在干净语音识别方面已进入低错误率区域。从统计HMM系统[rabiner1989tutorial, jelinek1997statistical]到大规模神经模型[baevski2020wav2vec, hsu2021hubert, gulati2020conformer, radford2023robust, puvvada2024less]的几十年进步,已使朗读语音的词错误率(WER)低于2%;然而解码器仍然会产生系统性的、领域特定的错误[chen2023hyporadise, likhomanenko2021rethinking, szymanski2020wer, ma2023n]和偏好[koluguri2026preference, hu2025chain, wu2026speecheq, hu2023scaling]。在经典的信源-信道识别公式[jelinek1997statistical]中,该公式在词汇和记忆之间进行调解[goldinger1996words, papcun1989long],这些正是当声学证据与不匹配的语言先验进行协调时预期的失败。这些错误[szymanski2020wer, stolcke2000dialog]在领域内是一致的,但在不同领域间有所不同:在财经新闻中,ASR系统将“Bentsen”呈现为“benson”;在航空旅行查询中,它将拼写形式的“u s air”合并为“us air”。因此,为一个领域调优的修复方案很难迁移到另一个领域。
参见图注图1:Voice Memory概览。在推理时,一个冻结的纠错器读取一个可学习、人类可读的文本记忆,并逐句决定是**执行**ASR假设还是**放弃**。离线时,一个优化器仅使用前向传播从训练语料中提炼出这份指令性记忆,无需权重更新,因此学习到的技能(i)在声学领域内泛化,并且(ii)跨领域和跨纠错器迁移。一种广泛采用的补救方法是生成式假设重写框架:将n-best解码假设(即ASR、OCR或机器翻译)传递给LLM,由其重写为单个转录文本[chen2023hyporadise, radhakrishnan2023whispering, thomas2024leveraging, yeo2025mms, hsu2025let, yang2025covoger, carofilis2026text]。例如,GER[yang2023generative]扩展了从基于BERT的假设评分[salazar2020masked]到编辑对齐的神经纠错[leng2021fastcorrect]的长期语言模型重打分和纠错工作,并在年度语音翻译竞赛和鲁棒ASR基准测试中取得了多项最先进成果。然而,在低错误率区域中,强大的LLM倾向于**过度纠正**:它会重写原本正确的token,将"homes"改为"home's",并将数字和拼写标准化为其自身的约定。每一次这样的编辑都是流畅的,但它却将输出移离了参考转录文本;在低可改善空间领域,零样本GER将WER提升至高于未编辑的1-best(§4 (https://arxiv.org/html/2607.26410#S4))。因此,纠错器面临的决定已经反转:在低于2%的WER水平下,问题不再是模型是否**能**修复错误,而是它是否应该修改假设。
我们将这种设置称为**智能体语音识别**,并精确给出定义。当一个ASR系统满足三个条件时,我们称其具有智能体性。第一,**决策**:它每句话在动作之间进行选择,在我们的例子中是**执行**假设还是**放弃**并保留原假设,而不是对每个输入应用一个固定的变换。第二,**持久状态**:它的决策依赖于一个显式的、可检查的、超越单个话语的状态,在我们的例子中是一个文本记忆,而不是激活值或权重。第三,**自我改进**:它根据自己打分输出上的反馈来修订该状态,无需人工干预。先前的工作在模型内部实现这些属性,通过微调全能模型来从音频中发出每句话的动作决策(§2 (https://arxiv.org/html/2607.26410#S2))。我们研究互补的、测试时的实现:决策策略存在于一个外部记忆中,一个冻结的纠错器在推理时读取该记忆。
定义1将这三个条件收集到一个单一形式中,我们称之为**监听者-思考者**(LT)架构。它扩展了通用的ASR-LM级联,即一个冻结的解码器$B_\phi$馈送给一个冻结的语言模型$M_\theta$,并精确包含这三个条件所需的两个对象:一个显式的动作分布$\pi$,分布在$\{\textsf{act},\textsf{abstain}\}$上,以及一个持久的文本状态$s$,由一个独立的、异步的优化器修订。监听者是同步路径,在流式处理时解码和决策;思考者是后台路径,在话语之间改进$s$。表1 (https://arxiv.org/html/2607.26410#S1.T1) 将该形式定位在两种主导的语音栈中:端到端ASR固定了映射且从不决策,SpeechLM始终发射并将状态保持在权重和上下文中,只有LT形式包含证据$H$、外部状态、逐话语动作$a$和自我改进的槽位。
定义1:监听者-思考者(LT)形式
令$x = (x_{\mathrm{Audio}}, x_{\mathrm{Text}})$为音频输入,$\hat{y} = (y_{\mathrm{Text}}, y_{\mathrm{Audio}})$为文本输出。一个**监听者-思考者**形式中的智能体语音系统是一个元组$(B_\phi, M_\theta, \pi, s, Op)$,其同步**监听者**$(B_\phi, M_\theta, \pi)$与一个优化器($Op$)一起工作:冻结的解码器$B_\phi$将$x$映射到文本证据$H = (h_1, \dots, h_n)$;冻结的$M_\theta$持有一个持久的、可检查的状态$s \in \Sigma^*$,通过动作$a \sim \pi(\cdot \mid H, s)$逐话语发射,使得
$p(\hat{y} \mid x, s) = \sum_a \pi(a \mid H, s) \, p_\theta(\hat{y} \mid H, s, a)$
其中:
$\hat{y} = \begin{cases} M_\theta(H, s) & a = \textsf{act} \\[1.0pt] h_1 & a = \textsf{abstain} \end{cases}$
而文本状态$s$仅由基于分数门控的**思考者**异步修订,保持$\theta, \phi$固定。
asr-lm(本文工作)和speechlm-lm是同一类型的不同签名:$x_{\mathrm{Text}} = y_{\mathrm{Audio}}$在话语时间尺度上,而完整签名在帧时间尺度上,且$\mathcal{A} \supseteq \{\textsf{act}, \textsf{abstain}\}$(说话、等待、委托)。常数策略恢复了经典情况:$\pi \equiv \textsf{abstain}$是端到端解码;$\pi \equiv \textsf{act}$,$s = \varnothing$是零样本GER情况,当思考者使用固定$\theta$和$\phi$参数时,包含失败回滚($F$)和成功回滚($U$)。
注1(与交互模型的关系)。LT形式是目前前沿正在出现的交互/后台分离的语音实例[tml2026interaction, huang2026duplexomni]:监听者是同步交互路径,思考者是异步后台路径,两者仅通过持久的工件文本状态$s$耦合。该工件使得这对组合具有可审计性和可移植性。
表1:语音系统的类型学。监听者-思考者(LT)形式将asr-lm(见定义1 (https://arxiv.org/html/2607.26410#S1),话语时间尺度)和speechlm-lm(完整签名,帧时间尺度)归为一个类型:只有LT列具有证据$H$、外部文本状态$s$、逐话语动作$a$和测试时自我改进的槽位。用现有的自适应机制表达这样的策略成本高昂。微调、LoRA[hu2022lora]和软提示[lester2021power]将自适应置于权重或连续向量中,这些无法被检查、无法跨模型家族迁移,也无法在不重新训练的情况下修订;少量示例[brown2020language]在每个请求上都会产生token成本。没有一种自适应方案能够同时实现仅推理、可审计和跨纠错器可移植。
我们提出Voice Memory,它将纠错技能存储在一个文本文件中。纠错器保持冻结,测试时读取一个单一的人类可读memory.md(图1 (https://arxiv.org/html/2607.26410#S1.F1))。一个独立的优化器将评分后的回滚转换为有界的添加/删除/替换编辑,并且仅当编辑严格提升一个保留分数时才接受该编辑[yang2026skillopt]。这个循环发现的主导策略是抑制:根据自身评分的错误,优化器编写抑制性规则,例如“保留逐字ASR token;不要标准化”,无需人工参与循环。在存在可恢复空间的地方,Voice Memory填补了1-best与最优结果之间的大部分差距;第二个纠错器运行相同的循环甚至超过了n-best最优结果,通过恢复任何假设中都不存在的token。我们稍后将为这两种智能体语音识别场景引入新的度量指标:(i)可恢复信息比率($\rho$)和(ii)有害编辑率。
本文做出四项贡献:
1. 1.**方法**。Voice Memory,一种用于智能体语音识别的仅推理自适应方案:纠错技能驻留在每个领域的文本记忆文件中,一个验证门控循环通过有界编辑改进该文件,无需权重更新(§3 (https://arxiv.org/html/2607.26410#S3))。
2. 2.**形式化与诊断**。对执行/放弃决策进行形式化描述,作为监听者-思考者形式(定义1,表1 (https://arxiv.org/html/2607.26410#S1.T1)),以及两个度量:**可恢复信息比率**($\rho$,相对于n-best最优结果的可恢复性)和**有害编辑率**(her,图2 (https://arxiv.org/html/2607.26410#S4.F2),针对过度纠正)。在九个领域中,纠错的收益与可恢复空间呈相关($r = {+}0.90$),界定了纠错器应执行操作的运作区域(§4 (https://arxiv.org/html/2607.26410#S4))。
3. 3.**可移植性**。有证据表明,优化后的记忆是一个可迁移的、与纠错器无关的工件:由一个模型家族编写的记忆可以改进另一个家族的解读者,并且该解读者可以使用相同的循环重新形成自己的记忆(§5 (https://arxiv.org/html/2607.26410#S5))。
4. 4.**噪声鲁棒性**。相同的抑制策略在CHiME-4和NOIZEUS上的声学噪声下仍然保持有效,无需微调或潜在噪声嵌入即可达到基于训练的鲁棒纠错水平(§6 (https://arxiv.org/html/2607.26410#S6))。
综合起来,Voice Memory为ASR和LLM纠错的级联提供了一条低成本的自适应路径:无需训练基础设施,一个小于10 KB的可审计工件,以及一份关于纠错器何时应该执行、何时应该保持静止的实测说明。
## 2 相关工作
#### ASR-LM与ASR智能体设置。
最近的工作将音频LLM视为智能体,它们决定如何使用内部感知和外部证据,而不是被动解码[wan2026speechhands, lin2025neko]。Speech-Hands[wan2026speechhands]和Speech-Mind[wang2026audio]与我们的工作最为接近。这些设置通过在全能模型上进行语音和音频推理的微调来学习逐话语动作token,因此其智能体性是基于声学的、在权重中学习的,并且每个话语重新决策。Voice Memory在这些轴的每一个上都不同(§1 (https://arxiv.org/html/2607.26410#S1)):它学习一个累积的记忆,不使用音频也没有训练,完全在推理时运行。这两种方法是一个想法的有训练版本和测试时版本:一个ASR系统决定何时信任自己的输出。
#### 生成式纠错与上下文偏向。
将领域特定知识注入ASR输出是一个长期目标。早期系统通过浅融合和即时重打分将上下文n-gram引入解码[aleksic2015bringing, zhao2019shallow]。端到端系统随后将偏向移入模型内部:CLAS[pundak2018deep]联合嵌入偏向短语并在解码期间关注它们,后来的工作将其扩展到RNN-T[jain2020contextual]和基于trie的深度偏向[le2021contextualized]。这些方法自适应声学模型,需要偏向列表和训练运行。基于LLM的GER则重新将纠错视为一个基于n-best假设的语言任务[chen2023hyporadise, yang2023generative, radhakrishnan2023whispering],通过微调或上下文示例来适应纠错器。Voice Memory位于这两条线的相反端点:它保持纠错器冻结,并将领域的约定写入推理时读取的文本记忆,无需偏向列表、无需训练、无需权重更新。
#### 噪声鲁棒ASR与鲁棒假设。
ASR-LM的一个常见用例是鲁棒ASR。声学噪声使得纠错更加困难,因为n-best列表本身也会退化,因此纠错器必须进行去噪而不是重新排序。鲁棒HyPoradise基准[hu2024large]将嘈杂的Whisper假设与干净参考配对,涵盖CHiME-4、VoiceBank-DEMAND、LibriSpeech-FreeSound和NOIZEUS。RobustGER将这些假设的多样性提炼为语言空间的噪声嵌入,并针对其微调纠错器,从而恢复大部分丢失的准确性。跨模态纠错器如NeKo[lin2025neko]通过任务引导的混合专家扩展了这一点。这两种方法都在潜在向量中读取噪声条件,并通过一次训练运行来付出代价。Voice Memory使用相同的观察结果,即n-best散布已经编码了噪声条件,但将先验写入每个噪声家族文本记忆,冻结的纠错器在推理时读取该记忆(§6 (https://arxiv.org/html/2607.26410#S6))。
#### 文本空间优化。
针对分数优化自然语言工件(如提示和技能)是梯度更新的替代方案[yuksekgonul2024textgrad, yang2024large, yang2026skillopt]。我们将其应用于ASR纠错,其中n-best最优结果设定了一个有界目标($\rho$)并且相似文章
CoreMem: 对话代理中长期记忆的黎曼检索与Fisher引导蒸馏
CoreMem提出了一种资源高效的边缘-云端内存架构,用于对话代理,采用基于Fisher-Rao度量的黎曼检索和Fisher引导的离散令牌蒸馏,在8 GB VRAM预算内实现了显著的准确性提升。
迈向类人交互式语音识别:基于智能体修正与语义评估
本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。
记忆深度,而非记忆访问:面向长时间运行语言代理的选择性参数整合
本文针对长时间运行的语言代理引入了记忆深度的概念,将其与基于检索的记忆访问区分开来,并提出了EVAF——一种利用惊喜和效价门控LoRA更新的选择性参数整合机制。跨多个模型的实验表明,EVAF在上下文卸载后以极少的参数写入提高了目标持久性。
Cognis:面向对话式 AI 智能体的上下文感知记忆系统
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
@MSFTResearch: AI 智能体无法记住过去的对话。它们必须不断重新加载或检索上下文,随着任务变长和复杂,效率变得越来越低…
Memora 是一种为 AI 智能体设计的可扩展记忆系统,它将存储与检索分离,能够支持长周期任务,同时将上下文令牌减少多达 98%,并在基准测试上取得了新的最佳性能。该论文发表于 ICML 2026。