面向工作负载驱动的设备端实时字幕翻译优化
摘要
本文提出了一种面向工作负载驱动的设备端实时英译繁中字幕翻译优化方法,通过将词汇量从15.1万降至6.4万,利用嵌入迁移和微调进行模型适配,在Apple M2上实现了1.63倍的加速比,且翻译质量具有竞争力。
arXiv:2607.09957v1 公告类型:新
摘要:本报告研究在短输入、短输出、批大小为1的推理、低延迟和隐私约束条件下,面向台湾地区的设备端英译繁中字幕翻译。这些条件限制了为长上下文或高吞吐量语言模型服务而设计的优化方案的价值。
从LMT-60-0.6B模型出发,初步分析表明,在GGUF量化降低了Transformer模块的相对成本后,词汇投影成为解码阶段更重要的成本。我们使用64k词符的字幕领域分词器替换原有的151k词符词汇表,迁移嵌入空间,并通过嵌入校准后进行全监督微调来适配模型。
在OpenSubtitles2024测试集的固定500样本子集上,LocalSubs在GPT-4o成对评判中与Google Translate相比取得了59.2%的排除平局胜率。性能在短提示上最强,并随提示长度增加而下降。初步的Apple M2 Metal测量显示,64k词汇量模型相较于151k词汇量基线模型实现了1.63$\times$倍的加速比。由于基准测试配置不完整,延迟结果视为初步。
查看缓存全文
缓存时间: 2026/07/14 04:21
# 面向工作负载的端侧实时字幕翻译优化
来源:https://arxiv.org/html/2607.09957
###### 摘要
本报告研究在短输入、短输出、单批次推理、低延迟和隐私约束下,面向台湾地区的端侧英文到繁体中文的字幕翻译。这些条件限制了为长上下文或高吞吐量语言模型服务而设计的优化方案的价值。从 LMT-60-0.6B[2] 出发,初步性能分析表明,在 GGUF 量化降低了 Transformer 模块的相对成本后,词汇投影成为更重要的解码阶段开销。我们用一个 64k 词表的字幕领域分词器替换了原有的 151k 词表,迁移了嵌入空间,并通过嵌入校准及后续的完整监督微调来适配模型。在 OpenSubtitles2024 测试集的一个固定 500 条子集上,LocalSubs 在 GPT-4o 成对比对评估中相对于 Google Translate 取得了 59.2%(排除平局)的胜率。模型在短字幕片段上表现最佳,随着片段长度增加而下降。在 Apple M2 Metal 上的初步测量显示,64k 词表模型相对于 151k 词表基线实现了 1.63 倍的加速。由于原始基准测试配置不完整,延迟结果被视为初步数据。
## 1 引言
实时字幕翻译所施加的约束与传统机器翻译和通用语言模型服务不同。每个请求通常只包含一个当前字幕片段和少量前文上下文。输入和输出都较短,推理实际上以单批次进行,并且必须在字幕显示窗口过期前完成翻译。对于隐私敏感的应用,完整的流水线还必须运行在本地消费级硬件上,同时生成台湾地区使用的自然繁体中文。
这些特点改变了推理瓶颈。当提示词较短且请求顺序到达时,为长上下文、重复前缀或大批量设计的技术带来的收益有限。在这种场景下,固定的单请求开销、解码阶段计算、词汇投影以及输出 token 数量对端到端延迟的影响可能更大。一个大型多语言分词器可能会进一步增加输出投影的成本,同时为特定领域的简体中文字幕文本提供低效的分词。
本研究基于 LMT-60-0.6B[2] 探索了一条面向工作负载的优化路径。原始的 151k 词表被替换为在英文和台湾繁体中文字幕文本上训练的 64k 字幕领域分词器。由于分词器替换改变了 token 的标识,并使原始嵌入矩阵失效,因此通过嵌入迁移、嵌入校准阶段以及完整的监督微调来适配模型。最终系统通过成对偏好判断与固定的 Google Translate 锚点进行比较评估,同时通过 Apple M2 Metal 的初步测量来考察部署性能。
主要贡献如下:
- • 一个 64k 词表的字幕分词器,降低了输出投影维度并提高了中文 token 密度。
- • 一种用于替换预训练翻译模型分词器的嵌入迁移及两阶段适配流程。
- • 基于成对偏好判断的翻译质量评估,包括上下文消融实验和字幕片段长度分析。
## 2 任务与设计目标
### 2.1 字幕级上下文感知翻译
模型接收最多三个前序英文字幕片段作为上下文,以及一个当前字幕片段作为翻译目标。模型只需输出当前片段的台湾繁体中文翻译。上下文用于消歧和语气连贯,而非作为额外的翻译内容。任务定义为:
\( y_t = f(x_{t-k:t-1}, x_t), \quad 0 \leq k \leq 3 \),
其中 \( x_t \) 是当前英文字幕片段,\( y_t \) 是其翻译。主要质量要求包括:语义正确、仅输出当前片段、自然的台湾用语、简洁的字幕风格,以及对简短含混话语的稳定处理。
### 2.2 端侧约束
目标环境有四个实际约束:
- • 低延迟:每个字幕片段应在字幕显示窗口内完成。
- • 小批量:交互式播放实际上为单批次。
- • 硬件有限:模型必须能在消费级设备(如 Apple M 系列系统)上运行。
- • 隐私:字幕内容应保留在本地设备上。
## 3 方法
### 3.1 工作负载概况与解码成本
本工作负载使用短提示词、短输出,且几乎没有可复用的前缀。因此,主要针对长注意力序列或大批量推理的优化方案收益有限。初步性能分析表明,在 GGUF Q5_K_M 量化降低了 Transformer 模块的相对成本后,输出投影在解码时间中占更重要的部分。每个解码步骤计算:
\( \mathrm{logits} = h W_{\mathrm{vocab}}^{\top} \),
成本与 \( |\mathcal{V}| d_{\mathrm{model}} \) 成正比。原始词表包含 151,936 个 token,隐藏层大小为 1024,因此每个解码步骤需投影超过 150,000 个 logits。这一观察促使我们采用组合策略:
1. 量化降低了每步 Transformer 的成本;
2. 分词器重新设计降低了投影维度,并可能减少中文解码 token 的数量。
由于操作级性能分析日志尚未完成,本报告将词汇投影视为一个受支持的假设,而非完全隔离的瓶颈。
### 3.2 64k 词表的字幕分词器
我们在英文和台湾繁体中文字幕文本上训练了一个 ByteLevel BPE 分词器。BPE 提供了开放词表的子词表示,同时允许对目标领域进行调优[1]。基础分词器包含 64,020 个 token;四个结构 token 使最终词表达到 64,024 个。
表 1:分词器替换效果
较小的词表将输出投影维度降低了约 57.9%。在同一段中文文本上,字幕分词器还提高了字符密度,从而减少了表示输出所需的 token 数量。该固定文本测量将分词器效率与模型生成行为的差异隔离开来。
### 3.3 嵌入迁移与两阶段适配
分词器替换改变了 token 的标识,并阻止直接重用原始嵌入矩阵。我们利用字符串级别的对应关系来初始化新的嵌入空间:
- • 若 token 字符串已存在,则直接复制原始嵌入;
- • 否则,用原始分词器对新的 token 进行分词,并平均对应的嵌入;
- • 仅在无法分解时使用平均回退。
所有 64k 基础词表 token 均已通过直接复制或子 token 平均完成初始化。四个结构 token 则单独从其原始字符串分解中初始化。未使用平均回退。
随后,模型分两个阶段进行适配:
嵌入迁移 → 嵌入校准 → 完整 SFT。
在嵌入校准阶段,Transformer 层被冻结,仅更新嵌入、输出头和 RMSNorm 参数。然后,完整的监督微调在最终的字幕数据集上更新整个模型。
## 4 实验设置
### 4.1 模型与训练数据
基础模型为 NiuTrans/LMT-60-0.6B,这是一个紧凑的多语言翻译模型[2,3]。LocalSubs 在一个经过质量过滤和长度平衡的字幕 SFT 数据集上训练。
表 2:核心实验配置
最终的 SFT 数据集结合了基于规则的清洗、繁体中文过滤、LLM 辅助的字幕对质量过滤、打乱以及增加对中长字幕片段的覆盖。过滤模型属于 Qwen3 系列[5]。详细的构建规则见附录 B。
### 4.2 评估数据与协议
OpenSubtitles2024 基准测试包含用于机器翻译开发和评估的双语字幕对齐数据[4]。主要质量评估使用一个固定的 500 条示例子集。主要协议是针对固定 Google Translate 锚点的成对偏好判断。GPT-4o 以随机 A/B 顺序和零温度对候选翻译和锚点翻译进行评判。指标排除了平局:胜率 = 胜场 / (胜场 + 负场)。基于 LLM 的成对评判具有可扩展性,但可能表现出位置偏差和其他偏见,因此随机化顺序和未来的人工审核很重要[6]。所有结果均报告样本量以及胜/负/平计数。字符级 F1、简体中文率和英文回声率仅用作表面形式的诊断指标。确切的 GPT-4o API 快照未保留;实验记录仅标识模型别名,这是可重复性的一个局限。GPT-4o mini 被用作云基线[8,9]。
### 4.3 部署基准测试
部署路径使用 llama.cpp、GGUF Q5_K_M 量化和 Apple Metal 后端。llama.cpp 提供本地推理、整数量化和针对 Apple Silicon 的优化支持[7]。记录的延迟摘要使用了单独的 64k 词表分析模型,而非最终用于翻译质量评估的模型。确切的原始日志、llama.cpp 提交、转换模型的校验和、预热次数以及运行次数均不完整。因此,延迟测量仅作为性能分析证据,而非最终部署声明。
## 5 结果
### 5.1 成对翻译质量
表 3:针对 Google Translate 的成对偏好结果
LocalSubs 相对于 Google Translate 取得了 59.2%(排除平局)的胜率,而在相同的锚点相对评估协议下,GPT-4o mini 的胜率为 64.6%。5.4 个百分点的差异表明,这个本地 0.6B 模型在严格得多的约束下(包括端侧执行、单批次推理、低延迟要求以及不依赖远程 API)已接近商业云模型的翻译质量。这一结果与目标应用尤为相关。我们的目标并非在无部署约束下最大化翻译质量,而是在保护隐私和实现实时本地推理的同时,提供有竞争力的字幕翻译。因此,最终模型代表了一种实际的质量-效率权衡,而非直接替代更大的云模型。由于两个系统均独立针对 Google Translate 进行评估,所报告的胜率是锚点相对的,并不构成最终模型与 GPT-4o mini 之间的直接成对比较。表面形式的诊断还显示简体中文率为 0.3%,英文回声率为 0.0%。字符级 F1 仅作为次要诊断指标,不作为翻译质量的主要度量。
### 5.2 上下文消融实验
表 4:在短字幕片段子集上针对相同 Google Translate 锚点的上下文消融实验
上下文使全集点估计变化了 0.6 个百分点。在独立定义的 260 条短响应子集上,有上下文的估计值高出 4.5 个百分点。表 4 中的区间是每种条件下的边际自助法区间,而非差异的配对区间。因此,4.5 个百分点的差异是描述性的,并非具有统计学显著性。
### 5.3 按字幕片段长度的性能
表 5:最终模型按源字幕片段长度的胜率
模型在短字幕片段上表现最强,在片段长度为 8 个词或更多时低于锚点。这一模式与定性观察一致:较长片段更容易出现遗漏和未完全保留含义的情况。16 词以上的结果仅为描述性,因为该子集仅包含 8 个示例。
### 5.4 嵌入校准对比
表 6:在 105 个对齐示例上的嵌入校准对比
对比结果支持在完整微调前进行嵌入校准。然而,char-F1 仅为表面指标,且存档的实验记录并未确定校准是两个训练运行之间的唯一差异。因此,该结果应视为支持性证据,而非完全隔离的消融实验。
### 5.5 初步延迟结果
表 7:Apple M2 Metal 初步性能分析结果
延迟差异与较小的输出投影和更密集的中文分词一致。然而,生成输出的 token 数量比较涉及两个系统,可能同时反映了分词器效率以及翻译长度或省略的差异。表 1 中的固定文本每 token 字符数结果是更清晰的分词器效率测量。端到端加速比小于仅解码阶段估计值,因为预填充、分词、运行时开销以及更高的英文提示词 token 数量仍然存在。这些测量需要在最终发布前进行可重复的重新运行。
## 6 讨论
### 6.1 分词器重新设计作为服务决策
量化和分词器重新设计处理的是延迟问题的不同部分。量化降低了 Transformer 模块的成本。较小的词表随后减少了输出投影的工作量,而字幕领域分词则以更少的 token 表示中文文本。因此,在此工作负载中,分词器设计并非仅仅是预处理选择,而属于服务架构的一部分。由于操作级性能分析器记录不完整,这一解释仍是暂时的。需要在相同模型、数据和部署设置下进行受控的 151k/64k/32k 对比,才能将词表大小与输出 token 数量及其他变化隔离开。
### 6.2 嵌入校准的作用
嵌入平均避免了随机初始化,但并不能保证与预训练语义空间对齐。直接进行完整微调要求模型同时适应新的嵌入分布和新的任务格式。校准阶段将这两个问题分开,并得到了存档对比的支持。早期的一次运行还表明,校准必须覆盖足够的数据分布。当使用有序的字幕数据且校准阶段非常短时,训练到后续、较不熟悉的内容时会出现训练/评估损失反转。详细诊断见附录 E。
### 6.3 质量权衡
观察到的优势主要集中于字幕风格和短字幕片段翻译,而非跨长度的广泛性能。最终模型在短字幕片段上通常能生成简洁、自然的台湾字幕措辞。其主要弱点是在较长片段上的过度压缩,导致细节遗漏和语义错误更频繁。定性检查还表明对某些情况的处理不稳定。相似文章
tencent/Hy-MT2-7B
腾讯开源了Hy-MT2系列快速思考的多语言翻译模型(1.8B、7B、30B-A3B),支持33种语言,同时提供了用于设备端部署的极端量化方法以及一个新的指令遵循基准IFMTBench。
Apple M3 Ultra上实时扩散模型推理的系统优化
本文对Apple M3 Ultra上的实时扩散模型推理进行了系统优化研究,通过CoreML转换和蒸馏模型在512x512分辨率下达到了22.7 FPS,揭示了针对CUDA优化的技术无法直接迁移到Apple统一内存架构。
面向印地语系语言的视觉引导电影字幕翻译
本文针对资源匮乏的印地语系语言进行了一项关于视觉引导电影字幕翻译的案例研究,证明选择性视觉接地(visual grounding)在解决时间错位挑战的同时,能够有效提升翻译质量。
Hy-MT2:一套快速、高效且强大的多语言翻译模型,面向实际应用
Hy-MT2 是腾讯推出的一套快速高效的多语言翻译模型,提供 1.8B、7B 和 30B-A3B 三种尺寸,支持 33 种语言,性能超越此前开源和商业模型。
翻译作为计算高效的桥梁:英语BERT用于低资源语言的可行性
本文探讨了基于翻译的微调作为低资源语言本地语言BERT模型的资源高效替代方案的可行性,发现在六项NLP任务中,53.3%的情况下其性能相当或更优。