APEX-VW:医疗领域文档级英西译后编辑数据集

arXiv cs.CL 论文

摘要

本文介绍了APEX-VW,一个基于NHS虚拟病房文档并在Trados Studio中进行专业译后编辑构建的新型文档级英西译后编辑数据集。该语料库旨在支持术语规范化、纠正传播以及人在回路翻译支持的研究。

arXiv:2608.08059v1 公告类型:新 摘要:机器翻译(MT)输出的译后编辑(PE)通常需要在多个片段中重复相同的词汇和术语纠正,尤其是在专业性强且高度重复的文档中。尽管在自动译后编辑(APE)方面已有大量工作,但大多数现有语料库在句子级别运作,其他则是合成数据,总体而言并非为研究纠正如何在真实计算机辅助翻译(CAT)工作流程中传播而设计。本文介绍了APEX-VW(虚拟病房自动译后编辑实验)语料库,这是一个新的开放英西(EN-ES)数据集,基于近期NHS虚拟病房文档和Trados Studio中的专业PE构建,并具有受控的MT、术语和质量保证设置。该语料库包含七个文档连贯的源文本,总计4.2万词,使用代表不同范式的四个MT系统进行翻译,然后由专业译员进行译后编辑。与WMT APE语料库、eSCAPE、MLQE-PE或LangMark等先前资源不同,该数据集保留了文档顺序和CAT工具上下文,适用于术语规范化、纠正传播和人机回环翻译支持研究。本文描述了语料库设计、数据准备、PE设置和初步语料库统计,并将该资源定位为文档级APE和传播感知辅助工具的基准。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:06

# APEX-VW:医疗领域中的文档级英语-西班牙语译后编辑数据集
来源:https://arxiv.org/html/2608.08059
\(2026\)

###### 摘要。

机器翻译(MT)输出的译后编辑(PE)通常涉及在众多片段中重复相同的词汇和术语修正,尤其是在专业性强且高度重复的文档中。尽管在自动译后编辑(APE)方面已有大量工作,但大多数现有语料库都是句子级别的,另一些则是合成的,总体上并非为研究修正如何在真实的计算机辅助翻译(CAT)工作流程中传播而设计。本文介绍了APEX-VW(Automatic Post-Editing eXperiments on Virtual Wards)语料库,这是一个新的开放英语-西班牙语(EN-ES)数据集,基于近期

相似文章

提升科学论述:科学领域的机器翻译

arXiv cs.CL

本文介绍了针对西班牙语-英语、法语-英语和葡萄牙语-英语的科学机器翻译平行语料库和单语语料库的开发,涉及四个领域:癌症研究、能源研究、神经科学和交通运输。这些语料库用于微调神经机器翻译系统,以解决科学文本中专业词汇和句法带来的挑战。

VEFX-Bench:通用视频编辑与视觉特效的全方位基准

Hugging Face Daily Papers

VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。

AVE-Compass:迈向音视频编辑能力的全面评估

Hugging Face Daily Papers

AVE-Compass 是一个用于全面评估音视频编辑能力的新基准,包含 145 个视频、196 条编辑指令和 2,688 个检查表项。它还提出了 AVE-Agent,一个模块化智能体框架,通过自我反思和评估器反馈改进跨模态编辑。