推理大语言模型中的隐藏语言一致性现象
摘要
本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。
arXiv:2608.08447v1 公告类型:新
摘要:多语言推理模型的评估通常关注是否得出正确答案,而不关注在推理和回答时是否保持了预期语言。这一遗漏掩盖了任务难度增加时出现的重要多语言行为。本文使用 PolyMath 基准,涵盖八种语言和四个难度级别,研究了任务难度、任务准确性、思维语言一致性(TC)和回答语言一致性(AC)。我们发现了四个结果:(1)语言一致性表现出四种依赖难度的行为:输出语言一致性保持与输入一致、保持不一致、逐渐退化或突然崩溃。(2)我们识别出语言一致性崩溃效应,即难度增加可能导致输出语言一致性突然下降,尤其是在代表性较弱和非拉丁文字语言中。(3)由于这种崩溃效应,在更难的难度级别上,模型转向其内部主导语言,准确性可能得以保持甚至提高。(4)量化可以独立于其对准确性的影响来改善或降低输出语言一致性,在基于容差的投票且 {\epsilon} = 1.0 的情况下,GPTQ 和 AWQ 通常优于 AutoRound。这些结果表明,多语言能力不能仅用准确性来表征;可靠评估应同时考虑任务准确性、语言一致性和任务难度。
查看缓存全文
缓存时间: 2026/08/11 08:08
# 推理大语言模型中的隐藏语言一致性现象 来源:https://arxiv.org/abs/2608.08447 查看 PDF(https://arxiv.org/pdf/2608.08447) > 摘要:多语言推理模型的评估通常只看是否得出正确答案,而不看其在推理和回答时是否保持预期语言。这一遗漏掩盖了随任务难度增加而出现的多语言行为。在本文中,我们使用 PolyMath 基准,在八种语言和四个难度级别上,研究推理模型的任务难度、任务准确率、思维语言一致性(TC)和答案语言一致性(AC)。我们发现了四个结果:(1)语言一致性表现出四种与难度相关的行为:输出语言一致性保持与输入一致、保持不一致、逐渐退化或突然崩溃。(2)我们发现了语言一致性崩溃效应,即难度增加可能导致输出语言一致性突然下降,尤其是在代表性较弱和非拉丁字母语言中。(3)由于这种崩溃效应,当模型转向其内部主导语言时,在更高难度级别下准确率可以保持甚至提高。(4)量化可以独立于其对准确率的影响而改善或降低输出语言一致性,在基于容差的投票(\epsilon = 1.0)下,GPTQ 和 AWQ 通常优于 AutoRound。这些结果表明,多语言能力不能仅由准确率来刻画;对于多语言基准,可靠的评估应同时考虑任务准确率、语言一致性和任务难度。 ## 提交历史 来自:Muhammad Ali Shafique [查看电子邮件(https://arxiv.org/show-email/df0ebd98/2608.08447)] **\[v1\]** 2026年8月9日 星期日 03:30:14 UTC(3,709 KB)
相似文章
大规模推理模型(尚)不是多语言潜在推理器
本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。
使用Layer Swap重新思考多语言推理差距
本文重新审视了LLM中的多语言推理差距,发现在可比较的监督条件下,该差距比先前报告的要小。本文引入了Layer Swap,它将来自英语推理专家的中间层权重转移到母语专家,几乎消除了这一差距,同时保留了母语链式思维。
揭示大语言模型中的数学推理:内部机制的方法学研究
本文通过早期解码分析大语言模型的内部机制,研究其如何执行算术运算。研究发现,能力强的模型在推理任务中,注意力模块和 MLP 模块之间呈现明确的分工。
mmPISA-bench:LLMs 在43种语言中的推理能力是否同样出色?
介绍 mmPISA-bench,一个源自PISA的紧凑型多语言推理基准,评估了专有LLMs在43种语言上的表现,发现它们能有效推理但存在一些性能差异,且机器翻译的问题不会降低准确率。
语言模型如何失败:承诺性与持续性推理失败的词元级特征
本文通过词元级不确定性信号,刻画了语言模型在推理中失败的两种不同过程——承诺性失败与持续性不确定性,并展示了其对自一致性及失败检测策略的启示。