PEARL:从自然语言出发的求解器在环交互式优化建模

arXiv cs.AI 论文

摘要

介绍了PEARL,一个用于交互式优化建模的系统,采用求解器在环方法,从自然语言出发迭代改进问题表述,其性能超越了DeepSeek-V3.2-685B等更大规模的模型。

arXiv:2607.18256v1 公告类型:新 摘要:优化建模是将现实世界中的决策问题(通常以自然语言描述)转化为正式的数学公式和可执行的求解器代码的过程。尽管大型语言模型的最新进展显示出了自动化这一过程的潜力,但现有的大多数方法仍属于一次性建模:模型一次性生成公式,不执行它,不根据求解器反馈进行条件调整,也不迭代修正错误。这与现实世界中的优化建模形成鲜明对比,后者本质上是交互式的,通过重复的“求解-调试-修正”循环进行。我们提出了PEARL,一个用于交互式优化建模的系统,它在此循环中利用Python执行和数学规划求解器。PEARL不依赖于固定的修正工作流程,而是学习何时测试部分模型,如何根据求解器诊断进行修正,以及何时停止。它在多轮工具集成环境中运行,其中中间执行结果、可行性信号和求解检查被用于在最终确定之前改进公式和求解器代码。在多种优化基准测试中,PEARL显著提高了验证求解率,超过了强大的一次性建模和工具增强基线;值得注意的是,我们的PEARL-Qwen3-\textbf{4B}模型在优化建模任务的宏平均和微平均准确率上均优于更大的DeepSeek-V3.2-\textbf{685B}模型。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:20

# PEARL:求解器在环的自然语言交互式优化建模
来源:https://arxiv.org/abs/2607.18256
查看PDF (https://arxiv.org/pdf/2607.18256)

> 摘要:优化建模是将现实世界中的决策问题(通常以自然语言描述)转化为正式数学公式和可执行求解器代码的过程。尽管近期大语言模型的进展已展现出自动化这一流程的潜力,但现有方法大多是「一次性」的:模型仅生成一次公式,不执行它、不依赖求解器反馈、也不迭代修正错误。这与现实世界中的优化建模形成鲜明对比,后者本质上具有交互性,并遵循反复的「求解–调试–修正」循环。我们提出 PEARL,一个在循环中利用 Python 执行和数学规划求解器的交互式优化建模系统。PEARL 无需依赖固定的修正工作流,而是学习何时测试局部模型、如何从求解器诊断信息中进行修正,以及何时停止。它在多轮工具集成环境中运行,利用中间执行结果、可行性信号和解决方案检查,在最终定型前改进公式和求解器代码。在多个优化基准测试中,PEARL 相比强劲的一次性方法和工具增强基线,显著提升了验证求解率;值得注意的是,我们的 PEARL-Qwen3-\textbf{4B} 模型在优化建模任务上,无论是宏平均准确率还是微平均准确率,均超过了规模大得多的 DeepSeek-V3.2-\textbf{685B}。

## 提交历史

来自:Hongliang Lu [查看邮件 (https://arxiv.org/show-email/2067fae2/2607.18256)] **\[v1\]** 2026年5月14日 星期四 06:47:20 UTC (1,486 KB)

相似文章

MILP-Evo: 闭环全自动MILP求解器设计

arXiv cs.AI

该论文介绍了MILP-Evo,这是一个闭环框架,利用LLM引导的程序进化来自动设计白盒MILP求解器组件(割选择器和分支规则),通过迭代生成和评估候选程序,并根据其在MILP实例上的端到端求解性能进行评估。

SocraticPO:通过交互式指导的策略优化

arXiv cs.LG

SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。

SPEAR:代码增强的智能体提示优化

arXiv cs.CL

SPEAR 是一个代码增强的智能体提示优化器,它利用 Python 沙箱进行结构错误分析,在包括工业裁判任务、BBH 和 GSM8K 在内的多个 LLM 评估套件上取得了最先进的性能。

OPERA: 通过基于目标困惑度的强化学习对齐开放式推理

arXiv cs.CL

OPERA提出了一种针对开放式任务的强化学习方法,利用困惑度动态作为内在奖励,取代了不可靠的“LLM作为评判者”奖励模型。在Qwen3-8B上实现了最先进的结果,在创意写作及其他开放式任务中可媲美专有模型。