标签
本文描述了向WMT26模型压缩共享任务提交的六个作品,使用路由感知的专家剪枝和MXFP4量化将GPT-OSS-20B压缩成更小的翻译模型,参数范围从4.186B到7.770B。
本研究评估了跨语言临床注释投影作为受限文本生成,比较了监督式、混合式和大型语言模型方法在六种语言中的表现。直接LLM投影优于先前方法,能够实现高质量的多语言临床注释转移。
论文提出了SALT,一种轻量级的后训练方法,通过向跨语言句子编码器注入跨度级监督来改进词元表示,在多语言词元级基准测试中取得最佳结果,并提升句子级性能。
SWORD引入了一个基于Wikidata的基准,用于评估LLM在拒绝事实错误时的跨语言不一致性,揭示模型依赖于分布熟悉度,并在亚洲语言中表现出性能下降。
该论文提出了中间语假设,认为大型语言模型通过将源文本编码到一个潜在与任务无关的特征空间中并从该空间解码来执行翻译,有经验证据支持其在方差、因果影响和单语微调方面的表现。
本文提出了一种针对汉语语言的跨语言罗马字生态系统,为普通话和粤语开发了具体方案,并在语音到罗马字任务中显示出比基线方法更优的性能。
本文提出了一种潜在空间干预方法,用于改善大型语言模型中的跨语言事实一致性,在不损失事实精度的情况下实现更好的对齐。
本文探讨了使用来自一种语言的功能向量来增强大语言模型中的多语言情感检测,表明这些向量能够捕获与语言无关的任务信号,并减少计算开销。
本文研究提示语言和响应语言如何影响LLM的内容生成,发现提示语言显著影响输出长度,同时通过概念改写保持语义保真度。
本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。
本文研究了通过指令微调通用大语言模型来实现健壮的有害内容缓解,特别是仇恨言论检测,使用了一个包含36个数据集的统一语料库,取得了最先进的性能,并增强了跨领域和跨语言的泛化能力。
本研究使用多语言编码器来测量Wikipedia各语言版本间的框架差异,发现宗教和政治概念的分歧大于科学概念。
LëtzCross 是一个用于卢森堡语PDF文档跨语言页面级检索的基准,比较了在低资源设置下纯文本和多模态检索器。
研究发现,在语音模型中,情感表示在七种语言中大多是通用的,有一个可衡量的‘口音’,这与人类跨文化研究相似,并影响跨语言迁移。
本文揭示了可验证奖励强化学习中的精确匹配验证器在多语言数学推理中引入了语言依赖偏差,提出了一个审计协议,并识别了跨语言选择瓶颈。
本文提出了一种针对语言模型水印跨语言公平性的评估框架,揭示了语言间的差异是语言类型学结构所致,而非特定语言的个别现象。
HealMed 是一个由专家审核的基准测试,用于评估医学领域大语言模型在九种语言上的表现,由医学专家开发以评估临床任务中的多语言性能。
本研究探讨了多语言大型语言模型如何在内部处理跨语言的主谓一致,发现模型为具有显性屈折变化的语言重用共享的计算结构,表明在形态句法处理中存在跨语言重叠。
OmniAlign 是一个统一的多语言对齐工具,它使用单个轻量级模型同时支持词级和句子级对齐,在基准测试中表现出色,并能良好地泛化到未见过的语言对。
本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。