当知识库成为金标准:衡量实体级机器翻译中资源共享的评估循环
摘要
本文衡量了在低资源历史领域中,当知识库被用作实体级机器翻译的金标准时所产生的自指性评估循环,表明知识库注入带来的提升仅限于重叠片段,并不能反映真实的翻译质量。
查看缓存全文
缓存时间: 2026/08/13 15:29
# 当知识库成为黄金标准:衡量实体级机器翻译中资源共享的评估循环 来源:https://arxiv.org/abs/2608.11843 查看 PDF(https://arxiv.org/pdf/2608.11843) > 摘要:《承政院日记》是联合国教科文组织《世界记忆名录》中的一项记录,目前仅有37.4%被翻译,而自动翻译中最显著的失败模式是人名——一个误读的名字破坏的是历史事实,而不仅仅是表面。低资源历史领域没有实体翻译的专家黄金标准,因此实践者用知识库(KB)替代黄金标准。而这个知识库正是注入系统的同一资源:评分变成自指,指标衡量的是指令遵从度,而非翻译质量。我们衡量了这一循环。我们以韩国国立历史研究所的专家人名标注作为独立于注入管道的黄金标准,保持实体集合不变,仅改变正确读法的来源。在527处专家标注的提及中,只有31.1%位于注入管道之外,且残余循环并非均匀分布——在重叠部分,注入读法与人工翻译的一致性为97.8%,而独立部分为70.1%,因此看起来最健康的部分恰恰是循环所支撑的部分。在四个模型上,双重差分分析表明,知识库注入带来的增益仅限于黄金标准与注入资源重叠的部分;在独立部分,增益为零或为负。尽管基线能力相差五倍,注入后的保持率却集中在0.910–0.996的狭窄区间内,因此所报告的增益是先前表现的补集,较弱的模型看似提升更明显。在通过移除构建过滤器而构建的独立样本上,该度量在同一模型内可复现(区间重叠),而在不同模型间具有区分度(区间不重叠)——它反映的是模型本身的性质,而非样本的性质。 ## 提交历史 来自:Jinhyung Bae \[查看邮件(https://arxiv.org/show-email/43b36a51/2608.11843)\] **\[v1\]** 2026年8月12日星期三 09:33:59 UTC(437 KB)
相似文章
知识超越语言:弥合多语言机器遗忘评估中的鸿沟
本文提出了两个新指标——知识可分性得分(KSS)和知识持久性得分(KPS)——用于评估大语言模型在多语言机器遗忘中的跨语言信息删除,弥补了以往单语言评估协议的不足。
KGCQual:一种用于评估文本知识图谱构建质量的可解释框架
本文介绍了KGCQual,一种可解释的度量标准,通过评估实体和关系对源文本的忠实度来评估自动构建的知识图谱的质量,并证明了其与下游性能的相关性。
利用可验证奖励强化学习激励参数知识以优化跨文化实体翻译
# 利用可验证奖励强化学习激励参数知识用于跨文化实体翻译 来源:[https://arxiv.org/html/2604.16881](https://arxiv.org/html/2604.16881) Jiang Zhou1, Xiaohu Zhao2, Xinwei Wu1, Tianyu Dong1, Hao Wang2, Yangyang Liu2, Heng Liu2, Linlong Xu2, Longyue Wang2, Weihua Luo2, Deyi Xiong1† 1天津大学 TJUNLP 实验室,中国 2阿里巴巴集团,中国 [dyxiong@tju\.edu\.cn](https://arxiv.org/html/2604.16881v1/mailto:[email protected]) ###### 摘
Position: Evaluation Scores Are Perishable Knowledge Claims
This position paper argues that language model evaluation scores should be treated as perishable knowledge claims, not ground truth, and proposes explicit metadata such as formality tier, scope declaration, and expiration date to counter 'trust inflation' caused by averaging weak and strong signals.
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。