基于大语言模型的运筹学不确定性感知仿真推断

arXiv cs.LG 论文

摘要

本文提出了一种无需训练、不确定性感知的推断框架,用于在运筹学中应用大语言模型。该方法使用短视前瞻仿真和重要性重采样来提高数学公式表述的一致性,在OR基准测试上优于标准基线。

arXiv:2608.00019v1 公告类型:新 摘要:将大语言模型(LLMs)部署到运筹学(OR)任务中仍然具有挑战性,因为正确性依赖于连贯的建模过程,而不仅仅是最终答案的正确。标准自回归生成基于短视策略运作,有时无法预测部分公式能否有效扩展为全局一致的优化模型。因此,局部看似合理的步骤可能传播为灾难性的下游公式或求解器代码错误。为解决这一问题,我们提出了一种用于OR数学建模的、不确定性感知的无需训练推断框架。在不更新模型参数的情况下,我们的方法使用短视前瞻仿真来评估中间候选步骤,以量化下游预测不确定性或概率集中度。然后,通过重要性重采样动态选择那些更可能生成连贯数学公式的候选。在多个OR基准(包括NL4OPT、MAMO和IndustryOR)上的实证评估表明,我们的框架始终优于标准和低温基线,为可靠的OR公式生成建立了一种高效、无需训练的新范式。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:36

# 面向运筹学的大语言模型不确定性感知模拟推理

来源:https://arxiv.org/html/2608.00019

郭亮  
中国人民大学统计与大数据研究院,北京 100872,中国\. liangguo000221@ruc\.edu\.cn

林少冲  
香港大学数据与系统工程系,香港 999077,中国\. shaoclin@hku\.hk

左俊-麦克斯·申  
香港大学工程学院与经管学院,香港 999077,中国\. maxshen@hku\.hk

张坤  

###### 摘要

将大语言模型(LLMs)应用于运筹学(OR)任务仍然具有挑战性,因为其正确性依赖于连贯的建模过程,而不仅仅是最终答案的正确。标准的自回归生成采用短视策略运行,有时无法预判当前的部分公式能否被有效扩展为全局一致的优化模型。因此,局部看似合理的步骤可能会传播为灾难性的下游公式化或求解器代码错误。为了解决这一问题,我们提出了一种面向OR数学建模的不确定性感知、无需训练推理框架。在不更新模型参数的情况下,该方法使用短前瞻模拟评估中间候选步骤,以量化下游预测不确定性或概率集中度。随后通过重要性重采样动态选择更有可能产生连贯数学公式的候选。在多个OR基准测试(包括NL4OPT、MAMO和IndustryOR)上的实证评估表明,我们的框架始终优于标准基线和低温基线,为可靠的OR公式生成建立了一种高效、无需训练的新范式。

*关键词*:大语言模型;不确定性感知;奖励函数;重要性重采样。

## 1 引言

运筹学(OR)将复杂的决策问题转化为由变量、约束和目标函数组成的形式化数学公式,其结构完整性直接决定高风险资源分配、调度和规划决策的质量。在过去,这一转化过程因缺乏能够从自然语言需求中可靠重构连贯优化模型的专家建模者而受到阻碍。尽管大语言模型(LLMs)的最新出现在自动化这一流程方面提供了有前景的途径,但其底层生成范式本质上仍受限于逐词元¹¹¹在语言模型中,词元是模型每一步生成的文本单元。图1(https://arxiv.org/html/2608.00019#S3.F1)展示了词元在LLM中如何生成。的自回归特性,即仅基于即时的局部概率评估每个后续步骤。因此,一系列各自看似合理的选择(例如引入一个孤立的约束或一个未索引的变量)常常会复合为全局不一致的公式,表现为约束冲突或决策域未定义。根本的结构性困难在于这种错位:数学模型的正确性是整个公式的全局属性,而构建它的生成策略却是局部运作的,这意味着局部最优性无法保证全局连贯性。当生成不稳定时,标准的缓解策略是低温采样²²²低温采样在LLM文献中也称为低温解码。本文采用“采样”来引导LLM的生成过程。,即通过降低温度参数来锐化局部分布,并在每一步更确定地承诺最可能的选择(Chen等,2021(https://arxiv.org/html/2608.00019#bib.bib3))。对于正确性主要依赖于单词语元准确性的任务(例如翻译流畅性和基本句法验证),这一启发式方法是合理的。在这些领域,较高的局部概率通常与较高的正确性相关,而抑制低概率的替代项能有效减少随机变化。然而,在OR建模中,主要的失败模式来源于一个根本不同的源头。生成的公式必须满足全局一致性要求,即变量必须在使用前定义,约束必须引用正确的索引集合,目标函数必须与决策域对齐。一个高概率词元并不天然比低概率替代词元更能保持这些下游性质。当早期建模错误位于高概率路径上时,低温采样并不会避免错误,反而会更确定地抵达错误。因此,降低温度控制的是词元级统计不确定性,而公式级结构不确定性完全未触及,这等于针对了错误的变异性来源。

与仅在词元层面运作的低温采样不同,具有可验证奖励的强化学习(RLVR)会根据轨迹级目标评估生成过程(Guo等,2025(https://arxiv.org/html/2608.00019#bib.bib9);Hu等,2025(https://arxiv.org/html/2608.00019#bib.bib11))。通过将概率质量移向能够优化全局奖励的候选路径,这种方法根据中间步骤的下游潜力而非其即时局部概率来重新加权这些选择。从这个意义上说,强化学习通过根据长期未来后果评估部分公式,解决了正确的结构性问题。然而,将这种范式部署于OR任务面临两个重大障碍。第一个障碍是实际的。评估数学公式通常需要密集的求解器集成,以验证可行性、最优性和约束满足情况。这使得自动化反馈在计算上昂贵、稀疏,并且难以在不引入意外激励的情况下设计迭代训练(Rafailov等,2023(https://arxiv.org/html/2608.00019#bib.bib26))。第二个障碍更为根本。最近的证据表明,训练后的强化学习主要通过在基础模型分布中已有的推理路径之间重新分配概率质量来发挥作用,而非注入全新的能力(Yue等,2025(https://arxiv.org/html/2608.00019#bib.bib39);Karan和Du,2025(https://arxiv.org/html/2608.00019#bib.bib21))。这些实际和概念上的局限性凸显了对一种无需训练替代方案的需求,该方案可以在推理时³³³注意,在LLM上下文中,“推理时间”指的是LLM从输入提示生成输出的运行阶段。这应与统计学中的“推断”区分开来,后者通常指基于观测数据对总体参数得出结论或检验假设。显式评估下游公式一致性,而无需模型重训练、外部奖励模型或参数更新。

在本文中,我们通过一个结合前瞻评估与重要性重采样的不确定性感知推理框架来开发这种替代方案。该框架不更新模型参数,而是通过使用短期未来模拟来评估当前部分公式的可靠性,从而在生成过程中转移概率。其直觉是:对齐良好的部分公式应导致未来扩展仍集中在兼容变量、约束和代码结构周围,而对齐不良的公式则更可能分支为不一致或不稳定的下游公式。我们通过两个基于前瞻的奖励函数来形式化这一直觉:一个基于下游概率集中度,另一个基于预测不确定性。通过从基础模型进行多次短滚动来估计这些奖励,并应用重要性重采样,该框架将更高的选择概率分配给结构可靠性更高的候选。因此,它在不需要额外监督、外部奖励模型或基于梯度的更新的情况下改善了OR生成。具体而言,本文作出以下主要贡献。

1. 1. OR建模中的短视策略失败示例。我们确定局部合理性并不能保证有效OR公式所需的全局结构完整性。通过两项互补分析,我们证明局部可能成立的建模选择可能传播为全局无效的公式和求解器错误——即使在低温采样下这种风险依然存在,低温采样往往还会增加模型对早期错误的置信度。通过量化OR推理的路径依赖性,我们发现正确的最终答案几乎完全来自无瑕疵的中间推理链,早期错误后的恢复可以忽略不计,这一特征要求转向轨迹级评估。
2. 2. 将多路径滚动与重要性重采样相结合的高效推理时框架。该方法引入两种奖励函数(幂奖励和熵奖励),通过下游概率集中度和预测不确定性来评估部分公式,捕捉了这样一个直觉:对齐良好的建模步骤会带来更连贯的未来延续。通过将这些奖励集成到重要性重采样过程中,该框架在生成过程中动态地将概率质量重新分配给可靠的推理路径,无需模型参数更新或外部奖励模型,确保了推理开销在复杂部署中仍可实际扩展。
3. 3. 跨多个不同OR基准的实证验证。我们提供了该框架在多个代表性OR基准上的有效性的广泛实证证据,包括NL4OPT、MAMO和IndustryOR。结果表明,所提出的方法在不同问题复杂度水平上始终优于标准采样和有竞争力的低温基线。值得注意的是,该框架在高约束优化场景中取得了最显著的性能提升,这意味着不确定性感知的轨迹评估对于解决复杂的工业级建模任务尤其关键,在这些任务中结构一致性至关重要。

本文其余部分结构如下。第2节(https://arxiv.org/html/2608.00019#S2)回顾了关于将LLM应用于优化建模、文本生成中的不确定性以及推理时干预方法的相关文献。第3节(https://arxiv.org/html/2608.00019#S3)介绍LLM生成的背景,并通过展示短视采样策略在高度路径依赖的OR任务中的不足来引出我们的方法。第4节(https://arxiv.org/html/2608.00019#S4)正式提出我们的不确定性感知推理框架,详细说明基于前瞻的奖励设计和重要性重采样程序。第5节(https://arxiv.org/html/2608.00019#S5)报告了跨多个OR基准的数值实验和实证结果。最后,第6节(https://arxiv.org/html/2608.00019#S6)总结全文并讨论未来研究的可能方向。所有数学证明和额外的生成示例均见附录。

## 2 文献综述

### 2.1 用于优化建模的LLMs

语言模型在OR领域的应用已从自动公式化系统发展为更专门的智能体驱动和基于训练的框架。早期工作将问题描述翻译为优化模型,并建立了NL4Opt作为该任务的基准(Ramamonjison等,2022(https://arxiv.org/html/2608.00019#bib.bib27),2023(https://arxiv.org/html/2608.00019#bib.bib28))。为处理更复杂的实例,OptiMUS将建模分解为公式化、求解器代码生成、调试和测试(AhmadiTeshnizi等,2024(https://arxiv.org/html/2608.00019#bib.bib2)),而Chain-of-Experts引入了具有规划和反思能力的专门智能体(Xiao等,2024(https://arxiv.org/html/2608.00019#bib.bib36))。近期,面向大规模优化建模的轻量级少量样本和工具使用框架已被开发出来,无需针对特定任务进行微调(Liang等,2026(https://arxiv.org/html/2608.00019#bib.bib16))。另一条研究方向依赖基准、合成数据和模型训练。MAMO基准通过求解器可验证实例评估数学建模能力(Huang等,2024(https://arxiv.org/html/2608.00019#bib.bib12)),而OptiBench基准在不同的问题类型上衡量优化建模,并引入ReSocratic数据合成用于监督微调(Yang等,2024(https://arxiv.org/html/2608.00019#bib.bib38))。沿着这一方向,ORLM框架通过半自动化数据合成和指令微调改进开源模型(Huang等,2025(https://arxiv.org/html/2608.00019#bib.bib13)),LLMOPT框架进一步增加了多指令微调和自我纠正以处理一般优化问题(Jiang等,2025(https://arxiv.org/html/2608.00019#bib.bib15))。最近的测试时强化学习方法还以更少的合成示例提高了建模和求解性能(Ding等,2026(https://arxiv.org/html/2608.00019#bib.bib6))。尽管取得了这些进展,随着任务复杂度的增加,复杂约束构造仍然是主要瓶颈(Chen等,2026(https://arxiv.org/html/2608.00019#bib.bib4))。与上述主要通过智能体或训练来改进OR建模的研究不同,我们的方法保持基础模型固定,专注于在推理时控制中间公式化选择。

### 2.2 语言模型生成中的不确定性

不确定性估计被广泛用于评估LLM输出的可靠性。校准研究表明,语言模型在问答中可能存在校准不良(Jiang等,2021(https://arxiv.org/html/2608.00019#bib.bib14))。较大的模型有时能够估计自己提出的答案是否真实,尽管这种能力取决于任务和提示格式(Kadavath等,2022(https://arxiv.org/html/2608.00019#bib.bib19))。在答案级置信度之外,最近的推理时方法使用不确定性来分配计算资源。例如,Entropy-Tree仅在高熵推理位置进行分支(Wei等,2025(https://arxiv.org/html/2608.00019#bib.bib34)),基于前瞻的解码使用未来模拟来评估候选步骤(Zhao等,2024(https://arxiv.org/html/2608.00019#bib.bib41)),自适应置信度采样依赖答案稳定性来指导重采样和终止(Shi等,2025(https://arxiv.org/html/2608.00019#bib.bib31))。另一个相关方向是测量语义级而非词元级的不确定性。语义熵将意义等价的生成分组,提高了正确性预测(Kuhn等,2023(https://arxiv.org/html/2608.00019#bib.bib22))。这一思想也被用于大规模检测幻觉(Farquhar等,2024(https://arxiv.org/html/2608.00019#bib.bib7))。然而,语义不确定性通常需要蕴含模型、LLM评判器,或对生成意义进行聚类。

### 2.3 推理时干预与重采样

推理时干预方法在不改变模型参数的情况下修改生成过程。引导解码和对比解码在词元概率层面进行干预。例如,F

相似文章

大型语言扩散模型的不确定性量化

arXiv cs.CL

本文首次系统研究了大型语言扩散模型(LLDMs)的不确定性量化(UQ),提出了从迭代去噪过程中衍生的轻量级零样本不确定性信号,并表明LLDMs能够在实现快速推理的同时,提供可靠的幻觉检测,与基于采样的基线方法相比,计算开销降低高达100倍。