标签
本文审计了多语言情感生成基准测试,揭示系统排名由测量伪影而非真实性能差异驱动,标注者变异性在其中扮演关键角色。
本文介绍了COILD,这是一个以印度语言为中心的平行语料库,包含超过116万对句子,覆盖20对印度语言,并提供了一个以领域为中心的基准。研究结果表明,在微调多语言模型时,机器翻译性能得到了显著提升。
本文提出一个用于越南劳动法跨语言法律问答的双语评估套件,评估检索、翻译和验证器引导纠正,以提高答案忠实度并解决不支持的主张。
AfriSyCo 研究AI模型在非洲语言事实内容中的答案切换现象,展示了断言性框架和验证提示如何在不同语言和模型检查点上显著影响准确性。
本文提出一种新的范围条件生成框架,该框架将结构化刻板印象特征整合到大型语言模型提示中,以实现有效的多语言反驳言论,并在一个由人工整理的数据集上验证,显示在事实性和有效性方面有显著提升。
本文研究变压器模型是否在多语言可读性评估中内化了与传统模型相同的语言特征,通过在五种语言上使用SHAP和TCAV进行分析。
论文提出了SALT,一种轻量级的后训练方法,通过向跨语言句子编码器注入跨度级监督来改进词元表示,在多语言词元级基准测试中取得最佳结果,并提升句子级性能。
本文分析了大语言模型对提供上下文的忠实度如何取决于其感知的合理性,使用多种语言的事实性、反事实性和虚构性RDF三元组。研究发现上下文-记忆冲突较弱,并强调LLM判断者的选择可能高估其强度。
本文介绍了VakyArth,这是首个针对印度语言的语用基准,评估LLMs在印地语、旁遮普语、泰米尔语和马拉雅拉姆语中的文化和上下文推理能力。研究发现模型在语用意义方面存在持续性失败,且在不同语言和任务间存在系统性差异。
本文介绍了质心干预融合 (CIF),一种投影融合框架,它统一了多语言干预算子以增强大型语言模型中的跨语言表示学习,特别在资源匮乏的语言上实现了性能提升。
本文研究提示语言和响应语言如何影响LLM的内容生成,发现提示语言显著影响输出长度,同时通过概念改写保持语义保真度。
本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。
本文研究大型语言模型(LLMs)是否能够对语音编码的语言进行解码,例如用西里尔字母书写的德语,以评估其在标准拉丁字母训练数据之外的抽象能力和性能。
跨语言排序偏好优化(CRPO)是一种新框架,通过层级排序优化将英语偏好知识转移到目标语言,从而增强多语言LLM的对齐,并在多种语言中展示出在指令遵循和知识利用方面的性能提升。
论文描述了提交给 WMT 2026 MIST 共享任务的内容,使用 Tiny Aya Global 模型以及为多语言摘要和问答任务专门设计的 QLoRA 适配器。
本文提出了一种用于分析斯里兰卡议会辩论的三语主题建模框架,该框架利用基于LLM的文本提取和多语言嵌入来处理语码混杂文本,并在聚类纯度上优于传统方法。
本文研究了当分词与语言建模联合优化时所学习到的词元,比较了跨多种语言的无分词器方法,发现它们为自然语言处理生成了独特而高效的词汇表。
本文证明嵌入空间结构不存在理论上的多语言诅咒,表明所需的最小维度仅随语言数量呈对数增长,这意味着实证问题源于数据和训练条件。
本文定义并量化了RLHF训练的摘要模型中的情感漂移,提出了一个策略归因框架来识别原因,并引入了一种情感感知KL正则化方法来减少漂移。
一份博士研究计划,概述了用于多语言隐喻处理的统一端到端框架,整合隐喻检测、翻译评估以及利用语言学理论和大语言模型的联合建模。