nlp-dataset

标签

Cards List
#nlp-dataset

ThaiTrees:泰语跨领域句法依存树

arXiv cs.CL ↗ · 6天前 缓存

ThaiTrees引入了一个3.42亿词的自动解析泰语跨领域语料库,采用Universal Dependencies下的可复现流水线,以支持句法研究和分析。

0 人收藏 0 人点赞
#nlp-dataset

FineWeb-CLaR:用于基准对齐语料审计的文化、语言和区域标注

arXiv cs.CL ↗ · 2026-09-23 缓存

本文介绍了FineWeb-CLaR,这是一个大规模标注数据集,为网页文档标注文化、语言和区域元数据,以实现对语言模型预训练数据和基准测试中文化表示的审计。

0 人收藏 0 人点赞
#nlp-dataset

CVSS-X:面向28种语言的多语言语音到语音翻译语料库

arXiv cs.CL ↗ · 2026-09-15 缓存

CVSS-X 是一个大规模合成语音到语音翻译语料库,扩展了 CVSS,实现了从英语到 28 种语言的翻译,包含超过 16,000 小时的平行语音对,用于双向研究。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈