cross-lingual

标签

Cards List
#cross-lingual

ESTS at WMT26: 路由感知的专家剪枝用于模型压缩

arXiv cs.CL · 20小时前 缓存

本文描述了向WMT26模型压缩共享任务提交的六个作品,使用路由感知的专家剪枝和MXFP4量化将GPT-OSS-20B压缩成更小的翻译模型,参数范围从4.186B到7.770B。

0 人收藏 0 人点赞
#cross-lingual

跨语言临床注释投影作为受限文本生成:一项六语言研究

arXiv cs.CL · 3天前 缓存

本研究评估了跨语言临床注释投影作为受限文本生成,比较了监督式、混合式和大型语言模型方法在六种语言中的表现。直接LLM投影优于先前方法,能够实现高质量的多语言临床注释转移。

0 人收藏 0 人点赞
#cross-lingual

通过SALT实现跨语言词元表示的改进

arXiv cs.CL · 4天前 缓存

论文提出了SALT,一种轻量级的后训练方法,通过向跨语言句子编码器注入跨度级监督来改进词元表示,在多语言词元级基准测试中取得最佳结果,并提升句子级性能。

0 人收藏 0 人点赞
#cross-lingual

SWORD:基于Wikidata的扭曲揭示了LLM事实错误拒绝中的隐藏跨语言不一致性

arXiv cs.CL · 4天前 缓存

SWORD引入了一个基于Wikidata的基准,用于评估LLM在拒绝事实错误时的跨语言不一致性,揭示模型依赖于分布熟悉度,并在亚洲语言中表现出性能下降。

0 人收藏 0 人点赞
#cross-lingual

中间语假设:LLMs 通过潜在与任务无关的特征空间进行翻译

arXiv cs.CL · 2026-09-02 缓存

该论文提出了中间语假设,认为大型语言模型通过将源文本编码到一个潜在与任务无关的特征空间中并从该空间解码来执行翻译,有经验证据支持其在方差、因果影响和单语微调方面的表现。

0 人收藏 0 人点赞
#cross-lingual

面向汉语语言的跨语言罗马字生态系统:普通话与粤语配对案例研究

arXiv cs.CL · 2026-09-01 缓存

本文提出了一种针对汉语语言的跨语言罗马字生态系统,为普通话和粤语开发了具体方案,并在语音到罗马字任务中显示出比基线方法更优的性能。

0 人收藏 0 人点赞
#cross-lingual

跨语言事实一致性的潜在空间干预:一致性提升而无精度下降

arXiv cs.CL · 2026-09-01 缓存

本文提出了一种潜在空间干预方法,用于改善大型语言模型中的跨语言事实一致性,在不损失事实精度的情况下实现更好的对齐。

0 人收藏 0 人点赞
#cross-lingual

跨语言功能向量用于大语言模型中的情感检测

Hugging Face Daily Papers · 2026-08-30 缓存

本文探讨了使用来自一种语言的功能向量来增强大语言模型中的多语言情感检测,表明这些向量能够捕获与语言无关的任务信号,并减少计算开销。

0 人收藏 0 人点赞
#cross-lingual

研究提示语言和响应语言对LLM内容生成的影响

arXiv cs.CL · 2026-08-28 缓存

本文研究提示语言和响应语言如何影响LLM的内容生成,发现提示语言显著影响输出长度,同时通过概念改写保持语义保真度。

0 人收藏 0 人点赞
#cross-lingual

压缩中的迷失:抽取式提示压缩器的跨语言可控审计

arXiv cs.CL · 2026-08-28 缓存

本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。

0 人收藏 0 人点赞
#cross-lingual

从专业化到通用化:指令微调大语言模型用于健壮有害内容缓解

arXiv cs.CL · 2026-08-27 缓存

本文研究了通过指令微调通用大语言模型来实现健壮的有害内容缓解,特别是仇恨言论检测,使用了一个包含36个数据集的统一语料库,取得了最先进的性能,并增强了跨领域和跨语言的泛化能力。

0 人收藏 0 人点赞
#cross-lingual

科学领域的趋同与宗教领域的分歧:Wikipedia各语言版本间经过校准的框架差异

arXiv cs.CL · 2026-08-25 缓存

本研究使用多语言编码器来测量Wikipedia各语言版本间的框架差异,发现宗教和政治概念的分歧大于科学概念。

0 人收藏 0 人点赞
#cross-lingual

L'etzCross: 一个针对卢森堡语文档的多模态检索跨语言页面级基准

arXiv cs.CL · 2026-08-25 缓存

LëtzCross 是一个用于卢森堡语PDF文档跨语言页面级检索的基准,比较了在低资源设置下纯文本和多模态检索器。

0 人收藏 0 人点赞
#cross-lingual

@nrol_ling: 七种语言,4,421条话语:情感在所有语言中是否以相同方式表示?大部分是的。几何形状对齐……

X AI KOLs Timeline · 2026-08-24 缓存

研究发现,在语音模型中,情感表示在七种语言中大多是通用的,有一个可衡量的‘口音’,这与人类跨文化研究相似,并影响跨语言迁移。

0 人收藏 0 人点赞
#cross-lingual

RLVR中的多语言验证器偏差:基准测试、Rollout诊断与跨语言选择瓶颈

arXiv cs.CL · 2026-08-24 缓存

本文揭示了可验证奖励强化学习中的精确匹配验证器在多语言数学推理中引入了语言依赖偏差,提出了一个审计协议,并识别了跨语言选择瓶颈。

0 人收藏 0 人点赞
#cross-lingual

语言模型水印中的跨语言公平性审计

arXiv cs.CL · 2026-08-21 缓存

本文提出了一种针对语言模型水印跨语言公平性的评估框架,揭示了语言间的差异是语言类型学结构所致,而非特定语言的个别现象。

0 人收藏 0 人点赞
#cross-lingual

HealMed:医学领域大语言模型的多语言评估

arXiv cs.CL · 2026-08-21 缓存

HealMed 是一个由专家审核的基准测试,用于评估医学领域大语言模型在九种语言上的表现,由医学专家开发以评估临床任务中的多语言性能。

0 人收藏 0 人点赞
#cross-lingual

共享电路与共享语法:跨语言的主谓一致追踪

arXiv cs.CL · 2026-08-20 缓存

本研究探讨了多语言大型语言模型如何在内部处理跨语言的主谓一致,发现模型为具有显性屈折变化的语言重用共享的计算结构,表明在形态句法处理中存在跨语言重叠。

0 人收藏 0 人点赞
#cross-lingual

OmniAlign:一个统一的多语言词对齐与句对齐工具

arXiv cs.CL · 2026-08-20 缓存

OmniAlign 是一个统一的多语言对齐工具,它使用单个轻量级模型同时支持词级和句子级对齐,在基准测试中表现出色,并能良好地泛化到未见过的语言对。

0 人收藏 0 人点赞
#cross-lingual

安全对齐幻觉:LLMs中的跨语言安全差距

arXiv cs.AI · 2026-08-20 缓存

本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈