标签
本文对普通话-英语、印地语-英语和西班牙语-英语的语码转换对话中的协同行为进行了跨语言分析,发现词汇协同具有泛化性,而声学韵律和风格协同则表现出差异。同时评估了分类模型捕捉这些行为的能力,结果显示模型优先考虑的特征与人类不同。
本文提出了一个用于攻击性语言检测中跨域和跨语言泛化的诊断与优化框架,将性能下降分解为数据集效应和语言效应,并量化了多语言能力与源任务性能之间的权衡。
本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。
本文提出了一种基于理据引导的知识蒸馏框架,用于跨语言立场检测,利用大型语言模型的思维链提示,通过双路径蒸馏和对比学习训练一个紧凑的学生模型。
本文研究了医学语言模型中的跨语言临床正确性漂移,发现本地可部署模型在用豪萨语查询时相比英语表现出显著的安全退化,而前沿模型保持能力,突显了低资源环境中安全评估的关键差距。
JOR-Bench 是一个包含五个日语基准测试的集合,用于评估大型语言模型在运筹学问题建模方面的能力,这些基准测试从现有的英语基准翻译而来。评估结果显示整体性能与语言无关,仅有轻微的跨语言差异。
本文提出了一种基于LLM的流水线,利用GPT-5、GPT-4o和Claude Sonnet 4自动设计跨语言手写OCR的神经网络架构,在阿拉伯语、英语和波斯语文本上实现了超过93%的准确率,无需人工干预。
本文研究了低资源自动语音识别(ASR)中跨语言迁移的问题,针对瓦尔皮里语提出了一种结合声学与语言特征的相似度框架,以选择最优源语言。实验表明,像阿萨姆语和印地语这样声学相似的语言能显著降低词错误率和字符错误率。
本文提出了一种可解释的基于网络的框架,使用二进制概念特征表示八种语言的习语表达。社区检测显示,习语按概念图式而非语言聚类,该框架在习语检测和跨语言迁移方面优于基于嵌入的基线方法。
本文探究预训练代码模型是否在其隐藏状态中编码了类型信息,通过对Java和Python示例使用线性探针进行研究。结果表明,即使是从无类型代码中也会出现跨语言的类型表示,并且这些表示对词汇扰动和句法变化具有鲁棒性。
本文系统研究了五种语言下基于LLM的医疗问答中的跨语言差异,发现了事实对齐方面的显著差距,并提出了MultiWikiHealthCare数据集。
本研究探讨了从僧伽罗语到迪维希语的跨语言迁移学习在自动语音识别中的应用,与仅使用迪维希语的基线相比,词错误率显著降低。
本文评估了大语言模型内部表示中的幻觉信号是否能够跨语言和领域泛化,重点关注阿拉伯语↔英语,使用TruthfulQA和HalluScore进行评估。结果表明,大多数模型具有可迁移性,跨语言性能取决于类别可分性和语言对齐程度。
介绍SPLIT,一个包含500条提示的基准测试,用于评估大型语言模型在英语和乌克兰语中的跨语言同理心和文化根基。研究发现,Gemini-2.5-Flash和LLaMA-3.3-70B-Instruct在处理乌克兰语时性能下降,而DeepSeek-V3保持稳定,且人类与AI评估者在文化维度上的一致性较弱。
本文介绍了CLeaD,一种使用WavLM嵌入进行跨语言语音抑郁检测的监督对比对齐框架。它揭示了先前结果因说话人身份信息泄露而被夸大的事实,并在普通话说话人上取得了适度改进。
介绍ALEE,一个使用抽象意义表示生成具有受控语义偏移的英语极小对的框架,并将其翻译用于评估275+种语言的文本嵌入,揭示了跨语言语义表示中持续存在的差距。
本文通过翻译SemEval-2010 Task 8基准数据集,并在零样本、少样本和QLoRA微调条件下评估Gemma 4,与更小的编码器基线进行比较,研究针对罗马尼亚语的跨语言关系抽取。
本文提出了一种针对大语言模型的红队测试框架,采用多角色架构系统性地揭示模型漏洞,尤其在忠实性方面。该框架在问答任务中实现了攻击成功率提升7.9%,并强调了架构选择对模型安全性的影响超过参数规模。