大语言模型数学问题求解中可执行推理约束下的表示鲁棒性
摘要
本文通过系统性地变化等价问题的表面表示,研究了大语言模型在数学问题求解中的表示鲁棒性,发现存在显著的敏感性,并表明代码增强推理并不能统一消除脆弱性。
查看缓存全文
缓存时间: 2026/07/24 05:04
# 大语言模型数学问题求解中可执行推理约束下的表示鲁棒性 来源: https://arxiv.org/abs/2607.20520 查看PDF (https://arxiv.org/pdf/2607.20520) > 摘要:大型语言模型(LLMs)在数学问题求解方面的评估日益增多,然而先前的研究通常将表示等价的不同表述视为可互换的,并将推理错误与接口故障混为一谈。本文通过系统性地改变同一底层问题的表面表示(包括故事型问题、文字方程、符号方程以及同构改写),研究了基于LLM的数学问题求解中的表示鲁棒性。我们利用一个数学等价问题的精选数据集,在直接答案生成条件下评估了五个当代LLM。我们发现显著的表示敏感性:模型在等价表述之间经常改变正确性,且在故事型、符号型和文字方程变体之间出现了非平凡的翻转率。我们还观察到在同构改写下存在系统性退化,表明即便细微的改写层面变化也会在保持数学结构不变的情况下降低性能。随后,我们评估了一种代码增强条件,其中模型将推理过程外化为可执行的Python代码,并在本地运行进行验证。这种接口揭示了某些在直接提示下表现不佳的模型具有强大的潜在推理能力,但并未均匀地提升鲁棒性。相反,失败在不同交互层之间转移:从隐式的推理错误到协议违规和执行失败。即使可执行推理成功,表示敏感性也常常持续存在。总体而言,我们的结果表明,推理脚手架并未消除表示的脆弱性,反而在正确性、可靠性、延迟和成本之间引入了新的权衡。我们认为,表示应被视为LLM评估和部署中的一等接口设计变量,尤其是在AI辅助问题求解系统中。 ## 提交历史 来自: Sagnik Nath [查看邮箱 (https://arxiv.org/show-email/6227b209/2607.20520)] **\[v1\]** 2026年7月8日周三 17:21:28 UTC (1,013 KB)
相似文章
大型语言模型中的数学推理:基准、架构、评估与开放挑战
本综述综合了大型语言模型在数学推理方面的最新进展,涵盖了基准、架构、训练策略和评估协议。它指出了推理忠实性和基准偏差等关键挑战。
揭示大语言模型中的数学推理:内部机制的方法学研究
本文通过早期解码分析大语言模型的内部机制,研究其如何执行算术运算。研究发现,能力强的模型在推理任务中,注意力模块和 MLP 模块之间呈现明确的分工。
大语言模型几何表示鲁棒性评测
# 大语言模型几何表示鲁棒性评测 来源:[https://arxiv.org/html/2604.16421](https://arxiv.org/html/2604.16421) Vedant Jawandhia 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Yash Sinha 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Ankan Pal 数学系,BITS Pilani
推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变化
本文使用 Claude Haiku 4.5 在 1000 个 GSM-Symbolic 问题上评估了三种方法(纯思维链推理、单次代码执行和迭代代码执行),发现思维链对扰动最为鲁棒,而代码执行并未提升小学数学问题的推理鲁棒性。
TabularMath:用大语言模型理解表格上的数学推理
TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。