标签
本文研究MGSM上原生语言与翻译之间的多语言推理差距是否是输出token预算的伪影。作者表明,在不同的硬性上限下,测得的差距显著波动,并且长度归一化可以逆转策略排序,因此得出结论:在评估中应将输出上限视为一个独立变量。
本文重新审视了LLM中的多语言推理差距,发现在可比较的监督条件下,该差距比先前报告的要小。本文引入了Layer Swap,它将来自英语推理专家的中间层权重转移到母语专家,几乎消除了这一差距,同时保留了母语链式思维。