非英语语言中的推理成本:以日语为例的研究
摘要
本文以日语为例,研究非英语语言中的推理计算成本,以揭示当前人工智能系统中的低效问题。
arXiv:2607.10114v1 Announce Type: new
摘要:推理语言模型(RLMs)在使用英语进行推理时表现最强,因为英语是推理导向训练数据最丰富的语言。然而,推理痕迹是模型可解释性和安全性的线索,并且对模型用户和开发者都具有实际用途。因此,能够开发出一种以用户选择的语言进行推理、同时保持强大推理性能的模型是很有必要的。为此,我们研究了训练一个以日语进行推理的模型的可行性。我们开发了Qwen-3-Swallow-8B的日语推理变体,该模型是在Qwen-3-8B基础上持续预训练的日语大语言模型,使用GRPO进行训练,并在编程、数学和科学基准上进行评估。研究表明,通过使用GRPO训练日语持续预训练模型,推理语言控制是可行的。然而,在多个基准上,其性能最多只与强英语推理基线持平。我们还对训练后的模型进行了日本文化基准测试,观察到其性能低于基线模型,这表明用日语推理并不能自动提升与文化相关任务的表现。
查看缓存全文
缓存时间: 2026/07/14 04:21
# 非英语语言推理的成本:以日语为例的案例研究 来源:https://arxiv.org/abs/2607.10114 参考文献工具 ## 参考文献与引用工具 文献探索器 切换 代码、数据、媒体 ## 本文相关的代码、数据和媒体 演示 ## 演示 相关论文 ## 推荐工具与搜索工具 关于 arXivLabs ## arXivLabs:与社区合作者共同进行的实验性项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。 与 arXivLabs 合作的个人和组织都接受并认同我们关于开放性、社区、卓越性和用户数据隐私的价值观。arXiv 坚守这些价值观,并只与遵守这些价值观的合作伙伴合作。 有什么能为 arXiv 社区增加价值的项目想法吗?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html)。
相似文章
推理的代价:神经机器翻译中强化学习的成本-质量权衡
研究了推理痕迹在神经机器翻译强化学习中的重要性,显示在推理过程中加入推理可以提升质量,但代价是增加计算需求。
@cerebras: https://x.com/cerebras/status/2067357992929153268
关于AI推理模型的经济性和性能影响的分析,表明启用推理可以将准确率提高10-20%,但消耗的token数量增加5-10倍,并讨论了不同的推理类型及其应用。
思考的代价:推理努力作为模型特定的API契约
本论文研究了AI模型API契约中推理努力参数的影响,基于对Sonnet 5的实验,表明显式高努力导致更高成本,而未检测到准确性提升。
大规模推理模型(尚)不是多语言潜在推理器
本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。
多语言思维,而非更难的思维:教授推理模型代码切换的数据高效框架
本文介绍了一个数据高效的微调框架,用于教授推理模型有效地进行代码切换(混合使用多种语言),证明了战略性的代码切换可以提升低资源语言的推理能力。该工作分析了大型语言模型在不同语言、任务和领域中的代码切换行为,并开发了促进有益代码切换模式的干预措施。