标签
本文通过经验回放和模型融合技术,将 IndicTrans2-1B 适应到 21 种印度语言的会话语域,在保持通用领域性能的同时取得了会话性能提升,但人工评估表明,基于指标的性能提升可能并未反映感知质量的改善。
介绍了 NagaTranslate,一个使用 Whisper、VITS 和 LLMs 针对低资源的那加兰克里奥尔语的翻译和语音合成流水线。
介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。
一项对比文学作品中人工翻译与AI翻译的研究表明,虽然机器翻译被视为“还行”,但读者仍因其沉浸感和清晰度更偏爱人工翻译。自动指标无法捕捉读者偏好。
本文提出了机器翻译中不可译性的结构化本体论,以及补偿策略的分类法和多语言数据集。人类偏好研究表明,翻译质量取决于所使用的策略,且对解释性翻译存在一致偏好。
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。
本文通过对比研究玛格丽特·阿特伍德的《羚羊与秧鸡》译成意大利语的情况,探讨大语言模型(LLM)翻译是否表现出可识别的情绪特征,以及后期编辑如何将其重塑为更接近人类的标准。
介绍 mmPISA-bench,一个源自PISA的紧凑型多语言推理基准,评估了专有LLMs在43种语言上的表现,发现它们能有效推理但存在一些性能差异,且机器翻译的问题不会降低准确率。
本文提出了一种新的多语言共指消解流水线,利用从英语到低资源语言的循环一致性机器翻译生成训练数据,并通过反向翻译和BERT相似性进行验证。在四种低资源语言上的实验表明,该方法带来了显著的性能提升,使得在没有现有语料库的语言中也能实现准确的共指消解。
引入ComplexityMT,这是一个使用CEFR级别评估六种语言中文本复杂度与机器翻译交互的基准测试,表明更高的复杂度使翻译更困难,并且机器翻译会改变复杂度级别。
本文系统评估了使用大语言模型在50种语言中进行目的驱动的机器翻译,发现明确的指令能显著提升适应质量,尤其是在非正式领域和更大模型中,而传统指标无法捕捉适应质量。
提出了G²C-MT,一种基于图引导的文档级机器翻译上下文选择框架,通过轻量级话语图和深度偏置随机游走来建模结构化话语依赖关系,在多个大语言模型上超越基线。
介绍Padyam2Gadyam数据集,该数据集用于将13至17世纪泰卢固语古典诗歌翻译成现代泰卢固语和英语散文,并评估了五种大语言模型在此任务上的表现。
KletterMix 是一个高质量的德语预训练语料库,通过将最先进的英语预训练数据集翻译成德语构建而成,同时保留其结构和多样性。控制实验表明,在 KletterMix 上训练的模型在德语基准测试中取得了可衡量的改进。
本文提出了一种基于模型的方法来评估大规模多语言平行数据,将其分解为平行性评估和无参考质量估计,发现没有任何单一的通用指标适用于所有语言方向。
本文提出使用接收者操作特征(ROC)分析来评估翻译质量评估(QE)系统,表明该方法能为商业决策提供可操作的性能见解,并与现有方法一致。
本文介绍了一种基于原则的多语言语言调控方法,该方法使用在多语言数据上训练的稀疏自编码器(SAEs)以及一种基于多语言对齐与语言可分性交集的新型层选择规则,并在LLaMA-3.1-8B和Gemma-2-9B上针对机器翻译和跨语言摘要进行了评估。
Hy-MT2 是腾讯推出的一套快速高效的多语言翻译模型,提供 1.8B、7B 和 30B-A3B 三种尺寸,支持 33 种语言,性能超越此前开源和商业模型。
Hy-MT2 is a new open-source multilingual translation model from Tencent Hy that supports 33 languages, offers flexible instruction capabilities, and achieves 2-bit quantization under 500MB for on-device deployment.
腾讯混元发布了Hy-MT2翻译模型系列,最高含30B参数的MoE模型,支持33种语言,并经过量化可用于设备端。