标签
本文来自小米,介绍了面向多语言机器翻译的无参考后训练,将带有质量评估奖励的GRPO应用于MiLMMT-46-v0.1 SFT模型,生成MiLMMT-46-v1.0,该模型提升了46种语言的翻译质量,并超越了开放和专有基线。
本文介绍了MiLMMT-46-v1.0,这是一个通过GRPO和检查点插值进行无参考后训练改进的多语言机器翻译模型,在46种语言上超越了强大的开放和专有基线模型。
提出了一种面向成本感知的LLM服务的两阶段级联框架,该框架将查询聚类并路由至最具成本效益的模型,然后将低质量输出升级至更强的模型。在降低推理成本的同时,保留了97-99%的准确率。
本文提出使用接收者操作特征(ROC)分析来评估翻译质量评估(QE)系统,表明该方法能为商业决策提供可操作的性能见解,并与现有方法一致。