multilingual-nlp

标签

Cards List
#multilingual-nlp

两个Emojis之差:多语言情感生成基准测试到底在测什么

arXiv cs.CL ↗ · 3天前 缓存

本文审计了多语言情感生成基准测试,揭示系统排名由测量伪影而非真实性能差异驱动,标注者变异性在其中扮演关键角色。

0 人收藏 0 人点赞
#multilingual-nlp

COILD:一个以印度语言为中心的平行语料库与跨语言机器翻译基准

arXiv cs.CL ↗ · 3天前 缓存

本文介绍了COILD,这是一个以印度语言为中心的平行语料库,包含超过116万对句子,覆盖20对印度语言,并提供了一个以领域为中心的基准。研究结果表明,在微调多语言模型时,机器翻译性能得到了显著提升。

0 人收藏 0 人点赞
#multilingual-nlp

跨语言法律问答针对越南劳动法:检索、翻译和验证器引导纠正

arXiv cs.CL ↗ · 4天前 缓存

本文提出一个用于越南劳动法跨语言法律问答的双语评估套件,评估检索、翻译和验证器引导纠正,以提高答案忠实度并解决不支持的主张。

0 人收藏 0 人点赞
#multilingual-nlp

AfriSyCo:针对非洲语言内容的断言性框架、验证与措辞敏感性测量

arXiv cs.CL ↗ · 2026-09-17 缓存

AfriSyCo 研究AI模型在非洲语言事实内容中的答案切换现象,展示了断言性框架和验证提示如何在不同语言和模型检查点上显著影响准确性。

0 人收藏 0 人点赞
#multilingual-nlp

解构刻板印象:用于有效多语言反驳言论的范围条件生成

arXiv cs.CL ↗ · 2026-09-16 缓存

本文提出一种新的范围条件生成框架,该框架将结构化刻板印象特征整合到大型语言模型提示中,以实现有效的多语言反驳言论,并在一个由人工整理的数据集上验证,显示在事实性和有效性方面有显著提升。

0 人收藏 0 人点赞
#multilingual-nlp

分析传统与神经网络方法在多语言可读性评估中的应用

arXiv cs.CL ↗ · 2026-09-11 缓存

本文研究变压器模型是否在多语言可读性评估中内化了与传统模型相同的语言特征,通过在五种语言上使用SHAP和TCAV进行分析。

0 人收藏 0 人点赞
#multilingual-nlp

通过SALT实现跨语言词元表示的改进

arXiv cs.CL ↗ · 2026-09-10 缓存

论文提出了SALT,一种轻量级的后训练方法,通过向跨语言句子编码器注入跨度级监督来改进词元表示,在多语言词元级基准测试中取得最佳结果,并提升句子级性能。

0 人收藏 0 人点赞
#multilingual-nlp

大语言模型在不信任输入数据时是否会犯更多错误?

arXiv cs.CL ↗ · 2026-09-10 缓存

本文分析了大语言模型对提供上下文的忠实度如何取决于其感知的合理性,使用多种语言的事实性、反事实性和虚构性RDF三元组。研究发现上下文-记忆冲突较弱,并强调LLM判断者的选择可能高估其强度。

0 人收藏 0 人点赞
#multilingual-nlp

VakyArth: 评估LLMs在印度语言中的语用能力

arXiv cs.CL ↗ · 2026-09-03 缓存

本文介绍了VakyArth,这是首个针对印度语言的语用基准,评估LLMs在印地语、旁遮普语、泰米尔语和马拉雅拉姆语中的文化和上下文推理能力。研究发现模型在语用意义方面存在持续性失败,且在不同语言和任务间存在系统性差异。

0 人收藏 0 人点赞
#multilingual-nlp

基于质心干预融合的跨语言表示学习

arXiv cs.CL ↗ · 2026-08-28 缓存

本文介绍了质心干预融合 (CIF),一种投影融合框架,它统一了多语言干预算子以增强大型语言模型中的跨语言表示学习,特别在资源匮乏的语言上实现了性能提升。

0 人收藏 0 人点赞
#multilingual-nlp

研究提示语言和响应语言对LLM内容生成的影响

arXiv cs.CL ↗ · 2026-08-28 缓存

本文研究提示语言和响应语言如何影响LLM的内容生成,发现提示语言显著影响输出长度,同时通过概念改写保持语义保真度。

0 人收藏 0 人点赞
#multilingual-nlp

压缩中的迷失:抽取式提示压缩器的跨语言可控审计

arXiv cs.CL ↗ · 2026-08-28 缓存

本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。

0 人收藏 0 人点赞
#multilingual-nlp

CyrillicQA:语音编码秘密语言对LLM性能的影响

arXiv cs.CL ↗ · 2026-08-25 缓存

本文研究大型语言模型(LLMs)是否能够对语音编码的语言进行解码,例如用西里尔字母书写的德语,以评估其在标准拉丁字母训练数据之外的抽象能力和性能。

0 人收藏 0 人点赞
#multilingual-nlp

对齐中的语言链:跨语言排序偏好优化

Hugging Face Daily Papers ↗ · 2026-08-24 缓存

跨语言排序偏好优化(CRPO)是一种新框架,通过层级排序优化将英语偏好知识转移到目标语言,从而增强多语言LLM的对齐,并在多种语言中展示出在指令遵循和知识利用方面的性能提升。

0 人收藏 0 人点赞
#multilingual-nlp

PSK 在 WMT 2026 MIST:用于多语言摘要和问答的任务专用 QLoRA 适配器

arXiv cs.CL ↗ · 2026-08-24 缓存

论文描述了提交给 WMT 2026 MIST 共享任务的内容,使用 Tiny Aya Global 模型以及为多语言摘要和问答任务专门设计的 QLoRA 适配器。

0 人收藏 0 人点赞
#multilingual-nlp

斯里兰卡议会辩论的三语主题建模

arXiv cs.CL ↗ · 2026-08-24 缓存

本文提出了一种用于分析斯里兰卡议会辩论的三语主题建模框架,该框架利用基于LLM的文本提取和多语言嵌入来处理语码混杂文本,并在聚类纯度上优于传统方法。

0 人收藏 0 人点赞
#multilingual-nlp

当分词与语言建模联合优化时,会学习到哪些词元?

arXiv cs.CL ↗ · 2026-08-19 缓存

本文研究了当分词与语言建模联合优化时所学习到的词元,比较了跨多种语言的无分词器方法,发现它们为自然语言处理生成了独特而高效的词汇表。

0 人收藏 0 人点赞
#multilingual-nlp

嵌入空间结构不存在理论上的多语言诅咒

arXiv cs.CL ↗ · 2026-08-19 缓存

本文证明嵌入空间结构不存在理论上的多语言诅咒,表明所需的最小维度仅随语言数量呈对数增长,这意味着实证问题源于数据和训练条件。

0 人收藏 0 人点赞
#multilingual-nlp

为什么摘要变得中立:基于人类反馈的强化学习中情感漂移的策略归因

arXiv cs.CL ↗ · 2026-08-18 缓存

本文定义并量化了RLHF训练的摘要模型中的情感漂移,提出了一个策略归因框架来识别原因,并引入了一种情感感知KL正则化方法来减少漂移。

0 人收藏 0 人点赞
#multilingual-nlp

迈向端到端多语言隐喻处理:整合检测、翻译与评估

arXiv cs.CL ↗ · 2026-08-06 缓存

一份博士研究计划,概述了用于多语言隐喻处理的统一端到端框架,整合隐喻检测、翻译评估以及利用语言学理论和大语言模型的联合建模。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈