标签
本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
本文研究了数据规模与延迟对流式ASR跨语言迁移的影响,发现多语言初始化的优势受限于数据量而非延迟,且随着目标语言数据的增加而减弱。
G-IdiomAlign是一个基于释义的基准,用于评估大语言模型中的跨语言习语对齐能力,采用受控多项选择和释义对比协议来诊断字面翻译偏差以及语义枢轴的影响。
本文提出了一种跨语言的LLM数学推理机制分析,发现数学相关参数在不同语言之间存在部分重叠,主要集中于中间层。英语拥有最大规模的数学相关参数集,而低资源语言则拥有较小的参数集。
本文通过七项任务、六种模型及类型多样的语言,实证研究了上下文学习中的跨语言迁移,表明基于微调的预期并不始终适用,并提出了源语言选择的新启发式方法。
本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。
本文介绍了NarrativeWorldBench,一个用于评估音频剧中长程叙事一致性的基准测试,以及N-VSSM,一个潜在状态空间模型,它在多个时间跨度和语言上优于前沿大型语言模型。
本文首次系统研究了视觉-语言-动作(VLA)模型中的多语言指令跟随问题,揭示了当模型基于英语训练时,在其他语言上的性能显著下降。作者提出了多语言主成分对齐(MPCA)方法来缩小多语言性能差距。
介绍XBCP(跨语言BrowseComp-Plus),这是一个用于在跨语言和多语言环境中评估深度研究智能体和检索器的基准。结果表明,当证据与查询语言不同时,性能显著下降,凸显了检索失败以及智能体在整合语言不匹配证据方面的困难。
一篇研究论文,提出了一种新的评估指标和重音感知系统,用于在英中语音到语音翻译中评估和保留词汇重音,实验表明在保持翻译质量的同时,其重音翻译能力显著优于现有方法。
本文提出了Judge-LS,一种评估LLM-as-a-judge模型在英语和中文之间语言切换是否不变的协议。研究发现,语言切换会导致10.7%至14.4%的偏好翻转,且评判者在英语中达到最高准确率。
本文介绍了SemCog Bench,这是一个精心整理的基准测试,包含1,858个阿拉伯语-希伯来语词对,并带有句子级别的注释,用于评估LLM区分真同源词、假同源词和借词的能力。结果显示,模型在真同源词上准确率很高,但在假同源词上准确率大幅下降,突显了跨语言语义推理中的一个关键局限性。
本文提出MLJailDe,一个多语言越狱检测框架,利用反向翻译数据增强和相对距离约束来提高跨语言泛化能力和鲁棒性,在11种语言上实现了98.5%的F1分数。
本文介绍了PolyFact,一个大规模多语言事实问答数据集,并展示了通过GRPO的强化学习相比监督微调能显著提升LLM的跨语言事实一致性,通过重组多语言表示。
提出一种利用语言特定统计图构建的领域感知发音错误检测与诊断方法,在L2-ARCTIC基准上达到59.52%的F1分数,优于多个基线模型。
DuDi 是一个双信号多语言蒸馏框架,结合序列级与词元级信号以及跨语言词语化器,旨在提升小型语言模型在东南亚语言上的表现。在 SEA-HELM 上的实验表明,DuDi 在多个模型系列和规模设置下均能持续超越具有竞争力的蒸馏基线方法。
本文利用塞尔维亚双文制作为受控测试平台,探究稀疏自编码器特征的自动生成标签是否跨语言和文字泛化。研究发现,尽管特征集在不同语言间存在显著重叠,但标签通常未能追踪非英语输入中的同一概念,尤其是在代表性较弱的文字中。
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。
XLGoBench 引入了一个合成算法任务基准,用于检测大语言模型中的跨语言技能差距,并在多个先进模型中展示了持续的差距。