标签
本文通过对比微调的NMT模型和少样本LLM,对阿拉伯语-俄语机器翻译进行基准测试,发现在低资源条件下,微调的NMT显著优于LLM。
EnSiTa 是一个支持英语、僧伽罗语和泰米尔语的三语多领域平行数据集和基准,包含人工后编辑的训练数据,并进行了大量领域特定机器翻译的实验,以应对低资源语言的挑战。
本文提出了一种系统性的标签感知结构化文本翻译方法,通过处理数据合成、能力构建和对齐,展示了比现有方法显著改进的效果。
本文介绍了COILD,这是一个以印度语言为中心的平行语料库,包含超过116万对句子,覆盖20对印度语言,并提供了一个以领域为中心的基准。研究结果表明,在微调多语言模型时,机器翻译性能得到了显著提升。
本研究对跨职业机器翻译评估指标的性别偏见进行基准测试,揭示男性化翻译倾向于获得更高分数,且偏见因语言和评估者而异。
本文分析了大型推理模型在机器翻译中的推理轨迹,发现推理收益是有条件的,并引入Hierarchical Meta-Summarization来理解轨迹模式。
本文提出一个三层清单-评判框架,用于评估机器翻译对话中口译智能体在语义、语用和文化-社会维度上的交际成功度,并通过广泛的基准测试进行了验证。
TACTICS是一种分类法感知的语料库采样方法,通过优化稀有类别的覆盖范围并提高较少片段的诊断能力来增强机器翻译评估。
本文介绍了MudawanSn,一个用于沃洛夫语-阿拉伯语机器翻译的高质量平行语料库,并展示了在该语料库上进行微调可以显著提高两个语言方向的翻译质量。
本文介绍了一种针对英白翻译的数据清洗流程和微调方法,重点处理白俄罗斯语的正字法复杂性并提升数据质量。
StalePO引入了一种用于机器翻译的令牌级偏好优化方法,该方法利用传统后编辑来提升模型性能,在质量指标上显示出显著提升。
本文提出了一种离散扩散框架,用于高效的一对多机器翻译,实现了随目标语言数量次线性延迟扩展,并支持对未见源语言的零样本迁移。
CRITICS项目通过大型语言模型实现机器翻译,旨在消除科学资料的语言障碍,促进科学教育中的批判性思维和资源普及。
North Small Translate 是一个基于LLM的开源机器翻译模型,拥有250亿活动参数,无需在推理时进行昂贵推理,即可在其类别中实现跨50种语言的顶级性能。
本文分析了在模型训练中,如何通过局部化人工校正中的编辑来放大相对选择偏差,并提供了来自机器翻译实验的理论见解和实证证据。
墨尔本大学提交了一个针对低资源太平洋克里奥尔语(如Tok Pisin、Bislama和Solomon Pijin)的领域平衡机器翻译模型,在WMT 2026 CreoleMT共享任务中,以超过3个chrF++点的优势超越了开放基线模型。
本文描述了一种在机器翻译评估中构建伪参考的方法,无需人工参考,利用多个翻译模型、质量估计和GPT-5.5后编辑来提高选择准确性。
本文提出了固定范围分块(FRC)用于文档级机器翻译,以确保长度一致性,减少训练-测试不匹配,并提升大型语言模型中的翻译质量。
TransClean 是一个基准,用于检测和提取来自大型语言模型输出的干净翻译,分析了超过 790,000 个翻译输出以识别噪声模式并评估提取方法。
CohereLabs 发布了 North Small Translate,这是一个开放权重的稀疏混合专家模型,拥有250亿活跃参数,用于支持50种语言的高质量机器翻译。