标签
Last Translation Benchmark 推出了一个实时数据集,包含经同行评审的多模态示例,旨在评估并突破领先的机器翻译模型,并配有手工验证规则以确保可靠评估。它针对当前基准测试的饱和问题以及自动指标的不可靠性。
该论文提出了中间语假设,认为大型语言模型通过将源文本编码到一个潜在与任务无关的特征空间中并从该空间解码来执行翻译,有经验证据支持其在方差、因果影响和单语微调方面的表现。
本研究评估了多语言句子嵌入在区分正确英希翻译与错误翻译方面的表现,发现这些嵌入提供了有用的语义信号,但更适合集成到更广泛的翻译评估框架中。
本文介绍了 Entropy-Valley,一种用于掩码扩散机器翻译的免训练长度选择器,它使用预测熵来提高充分性,表明长度选择比掩蔽顺序更为重要。
本文介绍了TranslatePsy-AfriSLM,这是一个针对19种撒哈拉以南非洲语言的开源机器翻译资源集合,表明通过过滤合成数据微调的小型语言模型在性能上超越了如TranslateGemma-27B和Qwen3.5-122B-A10B等更大规模的模型。
SuTRA是一种形态感知的词元化算法,它保留了印度语言中akshara的不可分割性,减少了形态破碎现象,并在机器翻译指标上相较于标准BPE方法有所提升。
本文提出了一种针对字节级分词的压缩方案,利用自动补全模型从输入序列中移除可预测的字节,在保持多语言机器翻译性能的同时缩短序列长度。
本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。
本文衡量了在低资源历史领域中,当知识库被用作实体级机器翻译的金标准时所产生的自指性评估循环,表明知识库注入带来的提升仅限于重叠片段,并不能反映真实的翻译质量。
本文介绍了OmnilingualGAIA2,这是GAIA2智能体基准在十种语言上的多语言扩展,揭示了8.8–18.4 pass@3点的普遍跨语言性能差距,该差距由模型驱动并随规模持续存在。作者认为,多语言智能体评估应成为全球部署智能体的标准。
本文提出了一种混合流水线,将基于微调LLaMA的性别分类与标签感知的神经机器翻译相结合,以缓解英语到罗马尼亚语机器翻译中的性别偏见,引入了新数据集,并在基准测试上将性别准确率提高了40多个百分点。
本文以基于最小对立的诊断框架,研究机器翻译的自动评估指标是否适用于文言文到英语的翻译。结果发现所有指标都存在盲点,其中 MetricX24 整体表现最佳。
本文介绍了APEX-VW,一个基于NHS虚拟病房文档并在Trados Studio中进行专业译后编辑构建的新型文档级英西译后编辑数据集。该语料库旨在支持术语规范化、纠正传播以及人在回路翻译支持的研究。
This paper presents an embedding initialization method for adding unseen low-resource languages to multilingual NMT models, evaluated on Limbum-English translation. The averaged multi-language embedding matches the best single proxy and drastically outperforms zero-shot and from-scratch baselines.
本文分析了五款大语言模型在英德互译中对时间、数字和日期进行本地化的能力,并测试了改进准确率的策略,发现将本地化原则嵌入提示上下文可带来统计上显著的改进。
本文探讨了三种基于大语言模型的英法双关语翻译方法,结合了对比学习与音义嵌入。其多智能体系统和引导式思维链系统在CLEF JOKER 2025任务2竞赛中,经专家人工评估,分别位列第一和第二。
一份博士研究计划,概述了用于多语言隐喻处理的统一端到端框架,整合隐喻检测、翻译评估以及利用语言学理论和大语言模型的联合建模。
论文比较了27种跨语言对齐(CLA)分数变体,用于预测LLM在多语言分类和翻译任务上的性能,并提出了一种基于PMI的翻译指标。研究发现,与英语的CLA对翻译质量的预测能力与源语言-目标语言CLA相当或更好,支持了LLMs使用英语作为内部枢轴语言的观点。
本文提出PAMT,一种面向多领域机器翻译的过程对齐强化学习框架,将领域感知的长思维链监督与步骤级过程奖励相结合,以改进对领域敏感的翻译决策。
介绍了TQLite,一种利用多LRM评审团训练小型语言模型进行基于MQM的实时翻译质量评估的蒸馏框架,其性能远超现成的SLM,同时保持成本效益。