Simulstream:用于评估和演示流式语音到文本翻译系统的开源工具包

arXiv cs.CL 论文

摘要

Simulstream 是一个开源框架,用于评估和演示流式语音到文本翻译系统,支持长语音的增量解码和重新翻译解码,并具备细粒度日志记录和交互式 Web 界面。

arXiv:2512.17648v2 Announce Type: replace Abstract: 流式语音到文本翻译(StreamST)需要在严格延迟约束下,随着传入语音同时生成翻译,要求模型在低延迟和高翻译质量之间取得平衡。尽管进展迅速,但评估仍然分散在现有框架中,这些框架对系统运行方式做出了不同的假设——例如,它们是否处理连续语音或短预分段的音频,以及在解码过程中是否支持输出修订(重新翻译)或不支持(增量)。因此,在不同研究中公平且一致地比较系统仍然具有挑战性。使用最广泛的框架 SimulEval 反映了这些局限性:它仅支持增量解码,假设输入为短分段音频,并且缺乏对系统演示的原生支持。更广泛地说,现有替代方案仅解决了评估和部署需求的一部分,没有留下用于基准测试和交互式演示的统一解决方案。为了填补这一空白,我们引入了 simulstream,这是第一个用于 StreamST 评估和演示的开源框架。它支持长语音的增量解码和重新翻译解码,为质量和延迟评估提供细粒度日志记录,并包含一个用于实时可视化和比较的交互式 Web 界面。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:55

# 用于流式语音到文本翻译系统评估与演示的开源工具包
来源:https://arxiv.org/html/2512.17648
Marco Gaido,Sara Papi,Mauro Cettolo,Matteo Negri,Luisa Bentivogli Fondazione Bruno Kessler,Trento, Italy \{mgaido, spapi, cettolo, negri, bentivo\}@fbk\.eu

###### 摘要

流式语音到文本翻译(StreamST)需要在严格的延迟约束下,与传入的语音同时生成译文,这要求模型在低延迟和高翻译质量之间取得平衡。尽管该领域进展迅速,但现有框架的评估仍然碎片化,它们对系统运行方式做出了不同的假设——例如,是处理连续语音还是短预分段的音频,以及是否支持输出修订(重翻译)或不支持(增量式)。例如,最广泛使用的框架SimulEval仅支持增量解码,假定输入为短分段语音,并且缺乏对系统演示的原生支持。因此,在不同研究之间进行公平且一致的比较仍然具有挑战性,目前没有统一的解决方案用于基准测试和交互式演示。为了填补这一空白,我们介绍了simulstream,这是首个用于StreamST评估和演示的开源框架。它支持对长语音进行增量解码和重翻译解码,提供细粒度的日志记录以进行质量和延迟评估,并包含一个用于实时可视化和比较的交互式Web界面。

- ![[未标注图片]](https://arxiv.org/html/2512.17648v2/imgs/github.png)

Simulstream:用于流式语音到文本翻译系统评估与演示的开源工具包

Marco Gaido,Sara Papi,Mauro Cettolo,Matteo Negri,Luisa BentivogliFondazione Bruno Kessler,Trento, Italy\{mgaido, spapi, cettolo, negri, bentivo\}@fbk\.eu

## 1 引言

流式语音到文本翻译(StreamST)任务要求在与说话者语音同步的同时翻译连续的长语音输入(Ren et al., 2020 (https://arxiv.org/html/2512.17648#bib.bib22)),这构成了自动语音识别和机器翻译交叉领域的一个重大挑战(Fügen et al., 2008 (https://arxiv.org/html/2512.17648#bib.bib17))。与离线翻译(整个话语在处理之前就已提供)根本不同,StreamST系统必须遵守特定的延迟约束,即从说出语音片段到生成其译文之间所经过的时间。具体来说,翻译输出必须与传入的语音同步或近乎同步地生成,以保持与说话者节奏一致。这个过程需要在仅拥有部分信息的情况下做出决策——通常称为策略(Grissom II et al., 2014 (https://arxiv.org/html/2512.17648#bib.bib23)),该策略必须在低延迟和高翻译质量之间取得平衡。尽管存在这些固有挑战,学术界和工业界的大量努力已推动该领域取得快速进展,这从相关出版物数量的不断增加中可见一斑(Papi et al., 2025 (https://arxiv.org/html/2512.17648#bib.bib16))。

提供StreamST输出主要有两种范式:重翻译和增量解码。重翻译在每次接收到新的源语言语音时,持续重新生成整个目标句子(或部分目标句子)。这种策略采用非单调解码方法,能够对先前输出进行动态自我修正和修订,以最大化翻译质量,但通常会导致可见的输出不稳定性,111https://research.google/blog/stabilizing-live-speech-translation-in-google-translate/ 称为闪烁(Arivazhagan et al., 2020b (https://arxiv.org/html/2512.17648#bib.bib20))。增量解码则不允许修订或删除先前生成的输出(采用“仅追加”方法),从而提供更稳定的用户体验(Dalvi et al., 2018 (https://arxiv.org/html/2512.17648#bib.bib27))。重翻译在工业应用中很普遍(Arivazhagan et al., 2020a (https://arxiv.org/html/2512.17648#bib.bib10)),因为它易于应用,无需对底层离线语音翻译模型进行特定修改或重新训练。相比之下,研究主要集中于增量方法,包括基于训练的方法(Schneider and Waibel, 2020 (https://arxiv.org/html/2512.17648#bib.bib21); Iranzo-Sánchez et al., 2021 (https://arxiv.org/html/2512.17648#bib.bib28); Ouyang et al., 2025 (https://arxiv.org/html/2512.17648#bib.bib19))和免训练方法(Polák and Bojar, 2024 (https://arxiv.org/html/2512.17648#bib.bib18); Papi et al., 2024 (https://arxiv.org/html/2512.17648#bib.bib11))。随着这两种范式的成熟,在一致条件下理解它们的权衡对于同声传译的进步至关重要。

然而,这些范式之间的系统比较仍然是一个开放挑战。现有框架通常仅支持StreamST管道的子集,阻碍了跨解码策略的公平和可重复的基准测试。最广泛使用的工具包SimulEval(Ma et al., 2020 (https://arxiv.org/html/2512.17648#bib.bib29))仅设计用于增量解码,不支持令牌删除,因此与重翻译方法不兼容。此外,它假设是短语音片段而非连续的长流,这限制了其对现代StreamST基准测试的适用性(Abdulmumin et al., 2025 (https://arxiv.org/html/2512.17648#bib.bib12); Polák et al., 2025 (https://arxiv.org/html/2512.17648#bib.bib26))。它还缺乏对交互式系统演示的支持,并且不再积极维护。222SimulEval已于2025年9月18日归档。除了SimulEval,只有少量替代工具被提出,但采用率低且仅提供部分解决方案:SLTev(Ansari et al., 2021 (https://arxiv.org/html/2512.17648#bib.bib32))支持两种范式但缺乏演示能力,而Lecture Translator(Huber et al., 2023 (https://arxiv.org/html/2512.17648#bib.bib33))提供Web界面但没有开放的评估后端。因此,社区缺乏一个统一的、维护中的框架来评估和演示StreamST系统。

为了填补这一空白,我们提出了simulstream,这是首个用于StreamST系统统一评估和演示的开源(Apache 2.0许可证)工具。我们的贡献如下:

- •我们引入了simulstream,这是首个统一的开源框架,用于在增量和重翻译策略下对StreamST系统进行长语音生成和评估,并能准确跟踪已发射和已删除的令牌。
- •我们提供了一个轻量级代理接口,可对接社区标准的SimulEval框架,支持直接重用现有系统而无需修改。
- •我们发布了一个基于Web的交互式演示平台,用于实时可视化和系统比较。333演示:https://youtu.be/k0WVOIMZFY8

除了支持可重复的基准测试外,simulstream还为在受控和一致条件下研究和比较不同的StreamST解码范式建立了通用基础设施。这种统一设置已促使其被采纳为IWSLT 2026评估活动同声传译轨道的官方评估工具包(Adelani et al., 2026 (https://arxiv.org/html/2512.17648#bib.bib37))。

## 2 simulstream工具

simulstream提供一个WebSocket服务器和支持工具,用于运行流式语音处理实验和演示。它支持通过流式音频输入进行实时转录和翻译。在此上下文中,流式假设一个连续、无限的语音信号,而不是像早期同声处理评估(例如SimulEval)中那样的一系列短预分段话语。短语音设置可以通过将输入音频拆分成连续的短片段来模拟。

参照图注图1:simulstream工具的架构。### 2.1 架构

该包基于全双工WebSocket客户端-服务器交互,如图1 (https://arxiv.org/html/2512.17648#S2.F1)所示。服务器等待客户端连接。客户端可以发送JSON格式的配置消息(例如,指定所需的输入/输出语言)和以16位整数编码的音频块。服务器处理输入音频并向客户端发送JSON,其中包含由配置的语音处理器生成的转录/翻译,该处理器实现了从传入音频生成输出的逻辑,类似于SimulEval代理。此外,如果配置为这样做,服务器会将指标日志写入JSONL文件,报告每一步生成的(和删除的)文本以及计算成本和处理的音频总量,这些可用于计算指标。

代码库分为三个主要模块:服务器、客户端和评估(见§2.3 (https://arxiv.org/html/2512.17648#S2.SS3))。

#### 服务器。

WebSocket服务器通过simulstream_server命令启动,该命令接受两个YAML配置文件。第一个定义服务器级别的设置(例如IP/DNS地址和端口),第二个指定语音处理器(见§2.2 (https://arxiv.org/html/2512.17648#S2.SS2))。服务器创建一个固定大小的处理器池以支持并发客户端执行。超出池容量的传入连接将被拒绝,从而提供对并发的显式控制,并防止高负载下的资源耗尽和内存不足错误。

参照图注图2:Web界面截图。
#### 客户端。

该工具带有两个客户端:一个HTTP Web服务器和一个命令行WAV客户端,分别用于语音处理器的演示和评估。HTTP Web服务器提供一个与WebSocket服务器交互的HTML/CSS/Javascript Web界面(见图2 (https://arxiv.org/html/2512.17648#S2.F2))。而命令行WAV客户端接受一个参数,该参数是一个包含要流式传输到服务器的WAV文件列表的文件,可用于生成评估语音处理器所需的指标日志。为进一步简化语音处理器的实验和评估,simulstream包含一个专用命令,该命令无需设置客户端-服务器交互即可处理音频列表,并将指标日志写入指定文件。

### 2.2 语音处理器

simulstream还附带多个流式语音处理器,这些处理器也可作为构建自定义处理器的示例。

- •滑动窗口(Sen et al., 2022 (https://arxiv.org/html/2512.17648#bib.bib5)):一种语音处理器,应用固定长度的滑动窗口重翻译并进行去重,以减轻处理未分段音频流时的输出重叠。该方法依赖于检测当前窗口与前一个窗口之间的最长公共子序列,以防止由重叠音频窗口引起的重复令牌。该方法已为Canary v2(Sekoyan et al., 2025 (https://arxiv.org/html/2512.17648#bib.bib9))、Seamless(Communication et al., 2023 (https://arxiv.org/html/2512.17648#bib.bib6))以及任何HuggingFace语音到文本模型实现。
- •StreamAtt(Papi et al., 2024 (https://arxiv.org/html/2512.17648#bib.bib11)):一种语音处理器,利用基于交叉注意力分数的语音-文本对齐。该机制有两个目的:(i) 识别应发射的生成假设部分(即应用AlignAtt策略;Papi et al. 2023 (https://arxiv.org/html/2512.17648#bib.bib15)),以及(ii) 根据文本历史(即先前生成的输出)确定应在内存中保留的音频历史部分,从而实现长语音处理。该方法已为Seamless和Canary实现,但可移植到任何基于注意力的HuggingFace语音到文本模型。
- •SimulEval代理包装器:一种包装处理器,用于调用基于SimulEval的代理。444它支持为SimulEval>=1.1.0实现的代理。这可以无缝移植任何使用旧工具开发的现有系统。
- •VAD包装器:集成语音活动检测(VAD)的语音处理器,具体使用Silero VAD(Team, 2024 (https://arxiv.org/html/2512.17648#bib.bib8))。其功能是将连续音频流分割为语音块,过滤掉不包含语音的部分,然后将剩余片段传递给底层语音处理器。

该仓库的结构便于通过自定义语音处理器进行扩展。为此,用户应创建simulstream.server.speech_processors.SpeechProcessor的子类,将该类添加到PYTHONPATH,并在语音处理器的YAML文件配置中引用它。子类必须实现加载模型、处理音频块、设置源/目标语言和清除内部状态等方法。语音块作为一维NumPy数组馈入,包含归一化到范围[-1.0, 1.0]并以16 kHz采样的PCM音频。其大小(以秒为单位)由语音处理器本身通过专用方法确定,语音处理器必须返回增量输出,包含要从先前生成的输出中删除的令牌(如果有)和要发射的新令牌。

### 2.3 评估

StreamST系统的评估通常被表述为延迟和翻译质量之间的权衡。simulstream为这两个维度提供内置指标,同时还提供一个简单接口用于集成自定义或额外的评估度量。此外,评估直接基于细粒度的指标日志,这些日志记录了语音处理器在推理过程中的完整行为。因此,新的指标可以在事后计算,无需额外信息,并可应用于任何先前执行的运行。

#### 质量。

大多数同声和流式ST工作仅依赖BLEU(Papineni et al., 2002 (https://arxiv.org/html/2512.17648#bib.bib1)),尽管越来越多的证据表明,与具有更高人类判断相关性的现代神经指标相比,BLEU是次优的(Freitag et al., 2022 (https://arxiv.org/html/2512.17648#bib.bib2))。因此,simulstream同时实现了BLEU(通过sacreBLEU计算(Post, 2018 (https://arxiv.org/html/2512.17648#bib.bib3)))和COMET555默认模型是Unbabel/wmt22-comet-da,但可以通过命令行参数指定其他模型。(Rei et al., 2020 (https://arxiv.org/html/2512.17648#bib.bib14))。这些分数是在对音频的完整生成文本进行重新分段以匹配参考文本的分段后计算的,参考文本假设按句子分段。这是通过mweralign(Post and Hoang, 2025 (https://arxiv.org/html/2512.17648#bib.bib13))实现的,mweralign是广泛使用的mwerSegmenter二进制可执行文件(Matusov et al., 2005 (https://arxiv.org/html/2512.17648#bib.bib4))的Python实现,该可执行文件已在ST评估活动(Abdulmumin et al., 2025 (https://arxiv.org/html/2512.17648#bib.bib12))和以往StreamST工作(Papi等人,2024 (https://arxiv.org/html/2512.17648#bib.bib11))中被采用。对于可能修订或删除先前发射令牌的流式处理器(例如,滑动窗口重翻译),仅对最终输出序列进行评估,不考虑中间修订假设。

#### 延迟。

simulstream包含StreamLAAL指标的重实现(Papi et al., 2024 (https://arxiv.org/html/2512.17648#bib.bib11)),用于后期处理延迟的评估。

相似文章

OpenSTBench:超越语义评估的语音翻译

Hugging Face Daily Papers

OpenSTBench 是一个统一的、多维度的语音翻译系统评估框架,能够联合评估翻译质量、语音质量、说话人保持、情感保真度以及延迟,涵盖离线与流式场景下的 S2TT 和 S2ST 系统。该框架弥补了分散评估协议带来的空白,并为比较异构语音翻译系统提供了一个可复现的基准。

一种针对长语音同声传译的实用评估方法

arXiv cs.CL

本文提出了一种针对长语音同声传译的实用评估方法,该方法利用自动语音识别(ASR)、强制对齐和句子嵌入对齐来计算连续语音的延迟和质量指标,克服了先前方法的局限性。

基于SpeechLLM的流式语音转文本翻译

arXiv cs.CL

提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。

基于自回归扩散变换器的流式同步空间音频生成

Hugging Face Daily Papers

SwanSphere 提出了一种统一的流式框架,通过因果自回归扩散变换器和多模态学习策略,从全景视频和文本提示中生成高保真空间音频,在视频到空间音频和文本到空间音频任务中均实现了卓越性能。