推理的代价:神经机器翻译中强化学习的成本-质量权衡
摘要
研究了推理痕迹在神经机器翻译强化学习中的重要性,显示在推理过程中加入推理可以提升质量,但代价是增加计算需求。
arXiv:2607.19226v1 公告类型:新
摘要:基于可验证奖励的强化学习(RLVR)已被确立为大型语言模型(LLMs)后训练的一种可行范式,包括神经机器翻译(NMT)等下游任务。最新研究表明,由于推理能力的引入,RLVR 可能成为翻译法律文档的首选训练方法,这引发了一个问题:这种改进究竟是归因于推理本身,还是更普遍地归因于训练范式?我们通过在训练和推理过程中系统地省略推理痕迹,研究了将模型推理痕迹纳入生成响应的重要性。实验表明,在推理过程中加入推理对整体翻译质量有积极影响。此外,我们注意到推理会导致输出 token 数量增加,因此我们研究了计算需求增加与翻译质量提升之间的成本-质量权衡。
查看缓存全文
缓存时间: 2026/07/22 08:25
# 推理的代价:神经机器翻译强化学习中的成本-质量权衡 来源:https://arxiv.org/abs/2607.19226 查看PDF (https://arxiv.org/pdf/2607.19226) > 摘要:带可验证奖励的强化学习(RLVR)已被确立为大语言模型(LLMs)后期训练的有效范式,其中涵盖神经机器翻译(NMT)等下游任务。最新研究表明,由于引入的推理能力,RLVR可能成为法律文档翻译的首选训练方法,这引发了一个问题:这种优势是否真正归因于推理本身,还是更普遍地归因于训练范式?我们通过在训练和推理阶段中系统地省略推理痕迹,研究了在生成响应中包含模型推理痕迹的重要性。实验表明,特别是在推理阶段包含推理痕迹,对整体翻译质量有积极影响。此外,我们注意到推理痕迹会导致输出token数量增加,因此我们将研究增加的计算需求与提升的翻译质量之间的成本-质量权衡。 ## 提交历史 来自:Michael Jungo [发送邮件](https://arxiv.org/show-email/c1d4030d/2607.19226) **\[v1\]** 2026年7月21日星期二 15:57:36 UTC(84 KB)
相似文章
推理语法:合成的语言学推理轨迹能否提升低资源机器翻译?
大语言模型能够通过结构化的语言学推理轨迹改善低资源语言的翻译,其最显著的效益出现在推理阶段而非训练阶段。
推理先行翻译:利用结构化推理增强法律机器翻译
本文比较了多种增强法律领域神经机器翻译的方法,包括监督微调和基于可验证奖励的强化学习。重点针对瑞士法律体系翻译,表明小型语言模型可显著增强,其中强化学习超越监督微调的性能。
非英语语言中的推理成本:以日语为例的研究
本文以日语为例,研究非英语语言中的推理计算成本,以揭示当前人工智能系统中的低效问题。
@cerebras: https://x.com/cerebras/status/2067357992929153268
关于AI推理模型的经济性和性能影响的分析,表明启用推理可以将准确率提高10-20%,但消耗的token数量增加5-10倍,并讨论了不同的推理类型及其应用。
@SOURADIPCHAKR18: 我们还测试了一个推理密集型回归任务:判断一个冗长且有缺陷的推理轨迹首次出错的位置。Peda…
该推文描述了一个推理密集型回归任务,用于评估有缺陷的推理轨迹首次出错的位置,并显示教学强化学习(Pedagogical RL)取得了最佳性能,NMSE降低18%,CCC提高5%。