推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL 论文

摘要

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。

arXiv:2608.08447v1 公告类型:新 摘要:多语言推理模型的评估通常关注是否得出正确答案,而不关注在推理和回答时是否保持了预期语言。这一遗漏掩盖了任务难度增加时出现的重要多语言行为。本文使用 PolyMath 基准,涵盖八种语言和四个难度级别,研究了任务难度、任务准确性、思维语言一致性(TC)和回答语言一致性(AC)。我们发现了四个结果:(1)语言一致性表现出四种依赖难度的行为:输出语言一致性保持与输入一致、保持不一致、逐渐退化或突然崩溃。(2)我们识别出语言一致性崩溃效应,即难度增加可能导致输出语言一致性突然下降,尤其是在代表性较弱和非拉丁文字语言中。(3)由于这种崩溃效应,在更难的难度级别上,模型转向其内部主导语言,准确性可能得以保持甚至提高。(4)量化可以独立于其对准确性的影响来改善或降低输出语言一致性,在基于容差的投票且 {\epsilon} = 1.0 的情况下,GPTQ 和 AWQ 通常优于 AutoRound。这些结果表明,多语言能力不能仅用准确性来表征;可靠评估应同时考虑任务准确性、语言一致性和任务难度。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:08

# 推理大语言模型中的隐藏语言一致性现象
来源:https://arxiv.org/abs/2608.08447
查看 PDF(https://arxiv.org/pdf/2608.08447)

> 摘要:多语言推理模型的评估通常只看是否得出正确答案,而不看其在推理和回答时是否保持预期语言。这一遗漏掩盖了随任务难度增加而出现的多语言行为。在本文中,我们使用 PolyMath 基准,在八种语言和四个难度级别上,研究推理模型的任务难度、任务准确率、思维语言一致性(TC)和答案语言一致性(AC)。我们发现了四个结果:(1)语言一致性表现出四种与难度相关的行为:输出语言一致性保持与输入一致、保持不一致、逐渐退化或突然崩溃。(2)我们发现了语言一致性崩溃效应,即难度增加可能导致输出语言一致性突然下降,尤其是在代表性较弱和非拉丁字母语言中。(3)由于这种崩溃效应,当模型转向其内部主导语言时,在更高难度级别下准确率可以保持甚至提高。(4)量化可以独立于其对准确率的影响而改善或降低输出语言一致性,在基于容差的投票(\epsilon = 1.0)下,GPTQ 和 AWQ 通常优于 AutoRound。这些结果表明,多语言能力不能仅由准确率来刻画;对于多语言基准,可靠的评估应同时考虑任务准确率、语言一致性和任务难度。

## 提交历史

来自:Muhammad Ali Shafique [查看电子邮件(https://arxiv.org/show-email/df0ebd98/2608.08447)] **\[v1\]** 2026年8月9日 星期日 03:30:14 UTC(3,709 KB)

相似文章

大规模推理模型(尚)不是多语言潜在推理器

arXiv cs.CL

本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。

使用Layer Swap重新思考多语言推理差距

arXiv cs.CL

本文重新审视了LLM中的多语言推理差距,发现在可比较的监督条件下,该差距比先前报告的要小。本文引入了Layer Swap,它将来自英语推理专家的中间层权重转移到母语专家,几乎消除了这一差距,同时保留了母语链式思维。