TeochewBench:一个经人工审核的潮州汉字翻译基准测试
摘要
TeochewBench 是一个经人工审核的基准测试,旨在评估潮州汉字翻译系统,为推进方言特定自然语言处理的研究提供资源。
arXiv:2609.18156v1 公告类型:新
摘要:潮州话拥有庞大的使用者群体,并表现出独特的词汇、句法和语用特征,然而用于评估大型语言模型的文本资源仍然有限。我们推出了 TeochewBench,一个经人工审核的基准测试,包含 300 个潮州汉字表达,用于评估从潮州汉字到普通话和英语的翻译。该数据集涵盖五个类别:基础词汇;日常句子;潮州特有表达;声调、礼貌和语境;以及习语、歧义和文化特定表达。一位主要的潮州话使用者审核员单独检查了所有条目并根据需要进行了修订,另外两位潮州话使用者验证了选定的项目。
我们的主评估涵盖了 11 个官方通用后训练模型在审核数据集上的两个翻译方向,产生了 6,600 个预测。两个官方基础检查点提供了 1,200 个预测用于补充诊断,总计 13 个模型和 7,800 个预测。我们还包含了一个汉字复制控制,它不改变源输入原样返回,以评估共享汉字如何影响普通话翻译的自动评分。Qwen3.5-27B 在评估的检查点中获得了最高的整体 chrF 风格分数,为 60.63,其次是 Qwen2.5-72B-Instruct 的 56.61、Gemma-3-27B-IT 的 56.36 和 GLM-4-32B-0414 的 55.82。在 11 个主评估模型中,平均 chrF 风格分数从低特异性项目的 69.25 下降到高特异性项目的 27.52。高特异性表达获得了较低的分数,并表现出较小的跨模型差异,表明它们在此处评估的模型系列中构成了一个共同的低分区域。汉字复制控制进一步表明,低特异性项目中的表面重叠可能会显著影响普通话翻译的自动评分。
查看缓存全文
缓存时间: 2026/09/17 09:09
# TeochewBench:经人工审校的潮州汉字翻译基准测试集 来源:https://arxiv.org/abs/2609.18156 文献工具 ## 文献与引用工具 文献浏览器切换 代码、数据与媒体 ## 本文相关代码、数据与媒体资源 演示系统 ## 演示系统 相关论文 ## 推荐系统与搜索工具 关于 arXivLabs ## arXivLabs:与社区合作者共同推进的实验性项目 arXivLabs 是一个支持协作者直接在我们网站上开发和共享 arXiv 新功能的框架。 所有与 arXivLabs 合作的个人和组织均认同并遵循我们关于开放性、社区共建、卓越标准与用户数据隐私的价值理念。arXiv 致力于维护这些原则,仅与遵循相同准则的合作伙伴开展协作。 若有能为 arXiv 社区创造价值的项目构想,**欢迎进一步了解 arXivLabs**(https://info.arxiv.org/labs/index.html)。
相似文章
HoWToBench:基于写作树结构的全方位 LLM 人类级写作评估
研究者发布 HoWToBench,一个涵盖 12 种文体、1302 条指令的大规模中文写作基准;同时提出 Tree-of-Writing(ToW)树状评估法,与人工评分的 Pearson 相关系数达 0.93,显著降低 LLM 写作评估中的偏差。
OpenSTBench:超越语义评估的语音翻译
OpenSTBench 是一个统一的、多维度的语音翻译系统评估框架,能够联合评估翻译质量、语音质量、说话人保持、情感保真度以及延迟,涵盖离线与流式场景下的 S2TT 和 S2ST 系统。该框架弥补了分散评估协议带来的空白,并为比较异构语音翻译系统提供了一个可复现的基准。
PaliBench:面向古典语言翻译基准的多参考蓝图
介绍PaliBench,一个用于巴利语到英语翻译的多参考基准,采用多位学者的独立翻译,并提供一种可复用的方法论,用于为古典语言创建类似的基准测试。
TW-LegalBench: 衡量台湾法律理解能力
TW-LegalBench 是一个评估大型语言模型在台湾法律理解能力方面的基准,包含超过16,000道选择题、117道论述题和14,000个法律判决预测实例。结果显示,顶级模型超过了律师考试及格线,但未达到法官和检察官的水平,凸显了在法律文本生成可靠性方面的挑战。
SEATauBench: 将工具-智能体-用户评估适配到低资源东南亚语言
介绍了SEATauBench,这是首个面向东南亚语言的智能体评估框架,将τ²-Bench适配到中文、越南语、泰语、印尼语和菲律宾语,并揭示了从英语迁移到本地化设置时存在显著的能力差距。