大语言模型数学问题求解中可执行推理约束下的表示鲁棒性

arXiv cs.AI 论文

摘要

本文通过系统性地变化等价问题的表面表示,研究了大语言模型在数学问题求解中的表示鲁棒性,发现存在显著的敏感性,并表明代码增强推理并不能统一消除脆弱性。

arXiv:2607.20520v1 公告类型: 新 摘要: 大语言模型(LLMs)在数学问题求解方面的评估越来越多,但以往的工作常常将表示等价的表述视为可互换,并将推理错误与接口失败混为一谈。本文通过系统性地变化同一底层问题的表面表示(包括故事问题、文字方程、符号方程和同构改写),研究基于LLM的数学问题求解中的表示鲁棒性。使用一个精心策划的数学等价问题数据集,我们在直接答案生成条件下评估了五个当代LLM。我们发现显著的表示敏感性:模型在等价表述之间经常改变正确性,在故事、符号和文字方程变体之间存在非平凡的翻转率。我们还观察到在同构改写下的系统性退化,表明即使微小的改写级别变化也可能降低性能,尽管数学结构得以保留。然后,我们评估了一种代码增强条件,其中模型将推理外部化为可执行的Python代码,并在本地运行进行验证。这种接口揭示了一些在直接提示下表现不佳的模型具有强大的潜在推理能力,但并未统一提高鲁棒性。相反,失败在交互层之间转移,从不透明的推理错误到协议违规和执行失败。即使可执行推理成功,表示敏感性也常常持续存在。总体而言,我们的结果表明,推理框架并不能消除表示脆弱性,而是在正确性、可靠性、延迟和成本之间暴露出新的权衡。我们认为,在LLM评估和部署中,特别是对于AI辅助问题求解系统,应将被视为一等接口设计变量。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:04

# 大语言模型数学问题求解中可执行推理约束下的表示鲁棒性
来源: https://arxiv.org/abs/2607.20520
查看PDF (https://arxiv.org/pdf/2607.20520)

> 摘要:大型语言模型(LLMs)在数学问题求解方面的评估日益增多,然而先前的研究通常将表示等价的不同表述视为可互换的,并将推理错误与接口故障混为一谈。本文通过系统性地改变同一底层问题的表面表示(包括故事型问题、文字方程、符号方程以及同构改写),研究了基于LLM的数学问题求解中的表示鲁棒性。我们利用一个数学等价问题的精选数据集,在直接答案生成条件下评估了五个当代LLM。我们发现显著的表示敏感性:模型在等价表述之间经常改变正确性,且在故事型、符号型和文字方程变体之间出现了非平凡的翻转率。我们还观察到在同构改写下存在系统性退化,表明即便细微的改写层面变化也会在保持数学结构不变的情况下降低性能。随后,我们评估了一种代码增强条件,其中模型将推理过程外化为可执行的Python代码,并在本地运行进行验证。这种接口揭示了某些在直接提示下表现不佳的模型具有强大的潜在推理能力,但并未均匀地提升鲁棒性。相反,失败在不同交互层之间转移:从隐式的推理错误到协议违规和执行失败。即使可执行推理成功,表示敏感性也常常持续存在。总体而言,我们的结果表明,推理脚手架并未消除表示的脆弱性,反而在正确性、可靠性、延迟和成本之间引入了新的权衡。我们认为,表示应被视为LLM评估和部署中的一等接口设计变量,尤其是在AI辅助问题求解系统中。

## 提交历史

来自: Sagnik Nath [查看邮箱 (https://arxiv.org/show-email/6227b209/2607.20520)] **\[v1\]** 2026年7月8日周三 17:21:28 UTC (1,013 KB)

相似文章

大语言模型几何表示鲁棒性评测

arXiv cs.CL

# 大语言模型几何表示鲁棒性评测 来源:[https://arxiv.org/html/2604.16421](https://arxiv.org/html/2604.16421) Vedant Jawandhia 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Yash Sinha 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Ankan Pal 数学系,BITS Pilani

TabularMath:用大语言模型理解表格上的数学推理

arXiv cs.CL

TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。