标签
ThaiTrees引入了一个3.42亿词的自动解析泰语跨领域语料库,采用Universal Dependencies下的可复现流水线,以支持句法研究和分析。
本文介绍了FineWeb-CLaR,这是一个大规模标注数据集,为网页文档标注文化、语言和区域元数据,以实现对语言模型预训练数据和基准测试中文化表示的审计。
CVSS-X 是一个大规模合成语音到语音翻译语料库,扩展了 CVSS,实现了从英语到 28 种语言的翻译,包含超过 16,000 小时的平行语音对,用于双向研究。