推理的代价:神经机器翻译中强化学习的成本-质量权衡

arXiv cs.CL 论文

摘要

研究了推理痕迹在神经机器翻译强化学习中的重要性,显示在推理过程中加入推理可以提升质量,但代价是增加计算需求。

arXiv:2607.19226v1 公告类型:新 摘要:基于可验证奖励的强化学习(RLVR)已被确立为大型语言模型(LLMs)后训练的一种可行范式,包括神经机器翻译(NMT)等下游任务。最新研究表明,由于推理能力的引入,RLVR 可能成为翻译法律文档的首选训练方法,这引发了一个问题:这种改进究竟是归因于推理本身,还是更普遍地归因于训练范式?我们通过在训练和推理过程中系统地省略推理痕迹,研究了将模型推理痕迹纳入生成响应的重要性。实验表明,在推理过程中加入推理对整体翻译质量有积极影响。此外,我们注意到推理会导致输出 token 数量增加,因此我们研究了计算需求增加与翻译质量提升之间的成本-质量权衡。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:25

# 推理的代价:神经机器翻译强化学习中的成本-质量权衡
来源:https://arxiv.org/abs/2607.19226
查看PDF (https://arxiv.org/pdf/2607.19226)

> 摘要:带可验证奖励的强化学习(RLVR)已被确立为大语言模型(LLMs)后期训练的有效范式,其中涵盖神经机器翻译(NMT)等下游任务。最新研究表明,由于引入的推理能力,RLVR可能成为法律文档翻译的首选训练方法,这引发了一个问题:这种优势是否真正归因于推理本身,还是更普遍地归因于训练范式?我们通过在训练和推理阶段中系统地省略推理痕迹,研究了在生成响应中包含模型推理痕迹的重要性。实验表明,特别是在推理阶段包含推理痕迹,对整体翻译质量有积极影响。此外,我们注意到推理痕迹会导致输出token数量增加,因此我们将研究增加的计算需求与提升的翻译质量之间的成本-质量权衡。

## 提交历史

来自:Michael Jungo [发送邮件](https://arxiv.org/show-email/c1d4030d/2607.19226) **\[v1\]** 2026年7月21日星期二 15:57:36 UTC(84 KB)

相似文章

推理先行翻译:利用结构化推理增强法律机器翻译

arXiv cs.CL

本文比较了多种增强法律领域神经机器翻译的方法,包括监督微调和基于可验证奖励的强化学习。重点针对瑞士法律体系翻译,表明小型语言模型可显著增强,其中强化学习超越监督微调的性能。