何时使用额外上下文:面向同声传译的基于证据的术语自适应
摘要
本文提出了EGTA,一种面向同声传译的基于证据的术语自适应框架,该框架选择性地使用文档特定术语来改进罕见词的翻译,在无需全模型微调的情况下,在命名实体和缩写召回率方面取得了显著提升。
arXiv:2607.17766v1 公告类型:新 \n摘要:额外上下文对于技术演讲的同声传译是有价值的,但将整个文档上下文注入到每个流式片段中通常过于粗粒度。通过诊断实验,我们发现上下文增益主要来自论文特定术语恢复,而非均匀语义增强。因此,我们提出了EGTA,一种基于证据的术语自适应框架,该框架构建文档术语记忆,根据当前流状态选择紧凑候选术语,并仅使用所选术语自适应ASR/语音侧和解码器侧决策空间。EGTA可以在级联、端到端和仅生成SimulST设置中实例化,无需全模型微调。我们在由MCIF-dev和ACL60/60-dev组成的ACL技术演讲SimulST评估套件上评估了EGTA。在MCIF-dev上,EGTA-RG在英$\\rightarrow$中和英$\\rightarrow$德方向上,BLEU提升了+1.05/+0.59,XCOMET-XL提升了+0.019/+0.006,命名实体召回率相对提升了79\\%/+73\\%,缩写召回率提升了+0.099/+0.171。在MCIF-dev的不同延迟设置中,EGTA一致地提升了XCOMET-XL、命名实体召回率和缩写召回率。在ACL60/60-dev上的外部验证进一步显示,无需额外微调即可获得一致的术语召回率提升。混洗记忆控制和激活审计提供了证据,表明改进与论文特定证据对齐相关,而非通用上下文提示。
查看缓存全文
缓存时间: 2026/07/21 06:46
# 何时使用额外上下文:面向同声传译的证据驱动术语适配 来源: https://arxiv.org/html/2607.17766 ###### 摘要 额外上下文对技术演讲的同声传译很有价值,但将整个文档上下文注入每个流式片段往往过于粗糙。通过诊断实验,我们发现上下文增益主要来自论文特定术语恢复,而非均匀语义增强。因此,我们提出EGTA,一个证据驱动的术语适配框架,它构建文档术语记忆,根据当前流式状态选择紧凑的候选术语,并仅使用所选术语调整ASR/语音侧和解码器侧决策空间。EGTA可实例化为级联、端到端及仅生成式SimulST设置,无需全模型微调。我们在由MCIF-dev和ACL60/60-dev组成的ACL技术演讲SimulST评测套件上评估EGTA。在MCIF-dev上,EGTA-RG在英→中方向提升BLEU +1.05/+0.59,XCOMET-XL +0.019/+0.006,命名实体召回率相对提升+79%/+73%,缩写词召回率提升+0.099/+0.171;在英→德方向亦类似。在MCIF-dev各延迟设置下,EGTA持续提升XCOMET-XL、命名实体召回率和缩写词召回率。在ACL60/60-dev上的外部验证进一步显示,无需额外微调即可获得一致的术语召回增益。打乱记忆对照组和激活审计提供了证据:改进源于论文特定证据对齐,而非通用上下文提示。 # 何时使用额外上下文:面向同声传译的证据驱动术语适配 杨泽宇1, 中村 哲11香港中文大学(深圳)通讯: [email protected], [email protected] ## 1 引言 同声传译要求系统在观察到完整话语或文档之前翻译语音。该设置对技术演讲尤其具有挑战性,因为演讲者频繁提及论文特定术语,如缩写词、模型名称、数据集、方法名称和命名实体。与普通词汇选择不同,这些术语往往稀有、新造或领域特定。即使周围句子流畅,遗漏或误译这些术语也会显著降低翻译流的实用性。 解决此问题的自然方法是向模型提供额外文档上下文,比如演讲标题、摘要或提取的实体。然而,在SimulST中如何使用这些上下文仍未充分探讨。一个直接方案是将整个上下文注入每个流式片段,通过提示、检索增强或隐藏状态适配。我们的诊断实验表明,这种统一策略往往过于粗糙:额外上下文可能改变表面风格或领域语域,而不一致地改善实际受益于上下文的术语保真度。在流式翻译中,许多片段不需要文档特定术语,只有提及论文特定术语的片段才需要精确的术语保留。 这一观察促使我们从通用语义上下文注入转向面向术语的、证据条件化的适配。我们不问模型是否应该始终使用文档上下文,而是问:*何时应该使用额外上下文,以及应用于何处?* 我们发现额外上下文最可靠的增益集中在论文特定术语上,而非均匀语义增强。因此,上下文适配应具有选择性,以当前流式状态为条件,并应用于术语错误产生的决策空间。 我们提出**EGTA**,一个**证据驱动的术语适配**框架,用于额外上下文的SimulST。EGTA首先从论文级上下文构建文档术语记忆,包括缩写词、模型名、数据集名、方法名及其他论文特定实体。对于每个流式片段,EGTA使用当前流式状态(如音频派生假设、转录上下文或部分翻译状态)从该记忆中选择紧凑候选集。然后将所选候选应用于ASR/语音侧和解码器侧决策空间。ASR/语音侧适配帮助系统听到或关注相关术语,解码器侧适配将解码偏向所选术语标记。我们使用“证据驱动”作为行为主张:模型应仅在语音条件证据支持时实现适配术语,我们随后通过激活审计和打乱记忆对照组验证这一点。 EGTA架构无关。相同的选定术语集可通过级联系统中的ASR热词、端到端语音语言模型中的紧凑术语上下文,或仅生成界面可编辑时的解码器侧logit偏置来暴露。这使得EGTA成为一个轻量级推理时框架,而非全模型微调方法。 我们在MCIF-dev和ACL60/60-dev上对英→中和英→德方向进行评估。使用基于Qwen3-Omni的固定端到端骨干,EGTA-RG在B=2时在MCIF-dev锚点提升BLEU、XCOMET-XL、命名实体召回率和缩写词召回率;ACL60/60-dev在无需额外微调下显示一致的术语召回增益。延迟前沿结果、打乱记忆对照组和激活审计进一步表明,增益来自正确的论文特定证据对齐,而非通用上下文提示。 我们的贡献总结如下: - •我们提出诊断分析表明,技术演讲SimulST中额外上下文的主要益处来自论文特定术语恢复,而统一上下文注入可能不可靠。 - •我们提出EGTA,一个证据驱动的术语适配框架,将推理时适配限制为从文档上下文和当前流式状态中选择的紧凑候选术语。 - •我们在端到端、级联和仅生成式骨干上分析EGTA,展示术语适配在何处提供最大改进空间,无需全模型微调。 - •在ACL技术演讲评测套件上的实验显示,XCOMET-XL、命名实体召回率和缩写词召回率持续提升,外部ACL60/60-dev验证和接地审计支持论文特定证据对齐。 ## 2 相关工作 ### 2.1 同声传译 同声传译需要在源语音仍在展开时平衡质量与延迟。先前工作研究了读写策略,如wait-k、单调注意力和信息传输策略,以及评估工具包和延迟指标,如SimulEval和长度自适应平均滞后等。这些方法主要改进分割、策略学习或延迟感知解码。我们的工作是补充性的:我们研究如何在使用额外文档上下文时,仅部分流式片段需要论文特定术语。 ### 2.2 上下文感知与术语感知翻译 上下文感知翻译已在文档级机器翻译和语音翻译中得到广泛研究,包括前句上下文、文档级上下文,以及模型是否实际使用上下文信号的分析。术语适配也通过词汇约束、字典注入、术语感知训练和词汇偏置进行了研究。这些工作表明,更广泛的上下文或外部词汇知识可以改善翻译,尤其在领域特定设置中。 SimulST提出了不同挑战:上下文必须在观察到完整话语或文档之前有用。将所有文档术语均匀注入每个片段可能使模型暴露于无关上下文并鼓励幻觉术语。因此,EGTA与一般文档上下文方法不同,它将上下文视为稀疏术语记忆,并仅当当前语音流提供支持证据时才激活它。 ### 2.3 语音语言模型与上下文偏置 端到端语音翻译和语音语言模型,包括Translatotron、SpeechT5和SeamlessM4T,直接将语音映射到目标文本或统一语音和文本建模。在语音识别中,上下文偏置和热词使用常用于改进稀有名称、技术术语和个性化词汇的识别。EGTA通过将术语适配分解为ASR/语音侧和解码器侧决策空间来连接这些想法,而不是将文档上下文视为应用于每个片段的均匀信号。 与先前研究上下文在句子或文档级是否有帮助的上下文感知SimulST工作不同,我们的关注点是流式推理期间何时应激活上下文。EGTA通过术语记忆构建、证据条件化候选选择和架构特定的ASR/语音侧和解码器侧适配来操作化该问题。 ## 3 方法 图1展示了EGTA的两阶段工作流程。本节详细说明术语记忆、证据条件化选择算法以及我们系统中使用的具体R/G适配接口。 图1:EGTA概述。底部面板展示准备阶段,文档上下文离线转换为紧凑术语记忆。顶部面板展示推理阶段:EGTA从当前流式片段提取局部证据,匹配到术语记忆,选择证据支持的术语,并将其用作推理时条件信号,以影响ASR侧、语音编码器侧和解码器侧决策。局部证据指当前片段中的线索,如部分转录或与术语记忆匹配的ASR假设。 ### 3.1 问题设置 给定输入语音流$X$,SimulST系统逐步接收音频块并在观察到完整话语或演讲之前输出目标语言文本。对于流式片段$i$,系统观察到部分语音输入$X_{\leq i}$并产生目标输出$Y_i$。在技术演讲中,我们额外假设可以访问文档级上下文$D$,例如论文标题、摘要、词汇表或自动提取的元数据。 目标是使用$D$改进术语保真度,而无需将无关术语引入不需要上下文的片段。一个朴素方法是将整个文档上下文拼接至每个流式输入。然而,这视所有片段为同等依赖上下文。EGTA则将文档上下文视为稀疏术语源,并将适配限制为片段特定的候选子集。 ### 3.2 术语记忆 EGTA将文档上下文$D$转换为术语记忆$T_D = \{t_1, \ldots, t_m\}$,包含对语音翻译困难的论文特定术语,包括缩写词、模型和数据集名称、方法名称、组织名称和技术短语。该记忆并非来自IWSLT提供的黄金词汇表。我们使用基于Qwen3-30B-Instruct的提示提取器(以FP8服务)从论文级上下文自动构建,包括标题、摘要和可用元数据。提取器提出候选命名实体和技术术语,之后我们通过大小写、标点、空格和连字符变体规范化术语。我们保留类似缩写词的字符串、字母数字或连字符技术名称、CamelCase术语和多词技术短语,同时过滤通用功能词和非技术元数据。候选命名实体被视为噪声术语列表而非黄金清单;EGTA使用局部语音证据从此列表中选择,而非信任每个提取的术语。每个术语存储表面形式和分词器级变体,用于ASR/语音侧条件和解码器侧标记偏置。附录A.2报告了记忆大小和术语类型统计。 ### 3.3 证据条件化候选选择 对于每个流式片段,EGTA从文档记忆中选择紧凑的术语子集。令$E_i$表示片段$i$的局部证据,包括当前语音片段、部分转录或ASR假设、附近历史以及部分目标侧状态。EGTA形成 $$T_i = A(T_D, E_i)$$ 其中$A(\cdot)$是算法1中的确定性推理时过程。选择器使用与$T_D$相同的规则规范化$E_i$,匹配表面形式、缩写词和分词器级变体,并按照精确匹配、特异性和最近性进行排序,受限于每片段术语预算。例如,如果当前部分假设包含“we evaluate on MCIF”,则提及“MCIF”是一个证据事件,激活记忆项MCIF。详细匹配规则和提示格式见附录A.3。 **运行示例**。考虑一个片段,其部分ASR假设包含“we evaluate on MCIF”,而文档记忆包含诸如MCIF、SimulEval和Qwen3-Omni等术语。选择器将观察到提及MCIF视为局部证据,将其排在未匹配的记忆术语之上,并仅将选定集合暴露给下游接口。EGTA-R将所选术语插入紧凑术语上下文或ASR热词列表,而EGTA-G仅偏置对应的解码器标记。未匹配的记忆术语仍可用于后续片段,但不会为当前片段激活。 算法1 流式片段$i$的EGTA推理 1: 文档上下文$D$,流式状态$E_i$,术语预算$K$,偏置强度$B$ 2: 从$D$构建或加载术语记忆$T_D$ 3: 规范化$E_i$中的ASR假设、部分转录和近期历史 4: 通过表面形式、缩写词或分词器级变体匹配$T_D$中的术语 5: 按精确匹配、缩写词匹配、特异性和最近性排序 6: 选择前$K$个证据支持的术语$T_i$ 7: 应用$R(T_i)$作为ASR热词或紧凑术语上下文
相似文章
EASE-TTT: 面向长上下文问答的证据对齐选择性测试时训练
提出 EASE-TTT,一种测试时训练框架,将自适应与检索到的证据对齐,以提高较小语言模型在长上下文问答中的性能。
AEGIS:增强感知的迭代保护引导
AEGIS是一个探索性框架,用于研究跨英语、普通话和韩语的跨度级引导的多语言去毒化,分析显式理由如何影响毒性降低与意义保留之间的权衡。
AdaGATE:面向多跳检索增强生成的自适应间隙感知、令牌高效证据集成
AdaGATE 是一种免训练的证据控制器,用于多跳 RAG。它采用以实体为中心的间隙追踪、微查询生成和基于效用的选择机制,提升了在噪声检索条件下的鲁棒性,在输入令牌更少的情况下达到了最先进的证据 F1 值。
人工智能辅助文化遗产传播:在岩画文档中比较NMT与术语表增强的LLM翻译
比较了DeepL、使用基本提示的Gemini以及使用术语表增强提示的Gemini在岩画西班牙语-英语术语翻译中的表现,发现术语表增强提示达到了最高的术语准确率(81.4%)。
对比ESA:同时对多个翻译进行人工评估
介绍对比错误跨度标注(cESA),这是一种同时对多个翻译进行人工评估的协议,与标准方法相比,减少了标注时间和噪声。