YUKTI: 从自然语言情境到鲁棒、可验证的决策——一种不确定性类型化的命题图、假设鲁棒帕累托前沿以及遗憾证书
摘要
本文介绍了YUKTI框架,该框架通过使用不确定性类型化的命题图、带有遗憾边界的假设鲁棒帕累托前沿以及多阶段优化交接,将自然语言决策情境转化为鲁棒、可验证的决策。在合成数据集和真实数据集上的验证表明,与朴素点解方法相比,它显著降低了遗憾,并揭示了语言模型推理的局限性。
arXiv:2607.09706v1 Announce Type: new
摘要:语言模型将文字描述的情境转化为数值计划,而主流流程(NL4Opt、OptiMUS、ORLM、OR-LLM-Agent)都致力于单一目标和点值系数,然后一次性求解。对于分配实际预算、精力或临床注意力的决策而言,这种信心就是失败模式:每一个被量化的数字都是一个假设,只有猜测完全正确时才最优的计划是脆弱的——这是对计算的模仿。YUKTI改变了自动建模的目标。其表示是一个类型化的命题图,其中的关系携带形状先验、系数不确定性和来源。YUKTI将每个阶段路由到精确、非线性或进化求解器;通过分布化帕累托交接耦合各阶段;并引入了假设鲁棒帕累托前沿(ARPF),通过重采样假设(包括结构性的ε-污染)来评估每个行动存活的频率(rho)。我们证明了一个界限,使rho成为遗憾的一个精确因子,增加了可审计的追溯性,并在不存在基准忠实数据时合成了一个这样的数据基础(SRJANA)。我们通过三种方式进行验证:在受控的错误规格下,鲁棒折中方案相比朴素点计划,将平均遗憾和尾部遗憾降低了90%以上;在一个受监管的商业决策中,我们在合法的行动空间内进行优化,并以欧元为代价定价下行风险;在一个包含41,188个决策的真实公开数据集上,样本外回测比记录的状态现状提高了34%,比朴素点规则提高了4%,同时减少了优化者的诅咒。求解器是标准的;我们不声称在基准上达到SOTA。直接对比表明,即使提供了正确的数值和单目标优化,语言模型产生的遗憾大约是YUKTI的47倍——语言模型是建模者,而非求解器。在长程因果耦合下,前向交接变得不可靠,这指明了必须转变为逆向归纳因果策略的位置。
查看缓存全文
缓存时间: 2026/07/14 04:16
# 从自然语言情境到稳健、可验证的决策:一种不确定性类型化命题中间表示、假设鲁棒帕累托前沿与遗憾证明——为何语言模型应负责表述而非求解
来源:https://arxiv.org/html/2607.09706(2026年6月)
###### 摘要
语言模型日益将文字描述的情境转化为数值化计划——而当前的主流管线(NL4Opt、OptiMUS、ORLM/LLMOPT、OR-LLM-Agent)都承诺采用*单一目标*和*点值*系数,然后一次性求解。对于分配实际预算、实地精力或临床注意力的决策而言,这种"自信"本身就是失败模式:每一个被客观化的数字都是一个假设,而一个仅在猜测完全准确时才最优的计划是悄然脆弱的。我们将这种风险称为*计算的模仿*——输出具有优化推荐*形式*但缺乏其实质内容。我们提出YUKTI,它改变了自动表述的*目标*。其中间表示是一个*类型化命题*图,其中每个关系都承载形状先验、系数*不确定性分布*以及来源标注。在此基础上,YUKTI:(i)通过探测结构将每个阶段路由到精确、非线性或进化求解器;(ii)通过*分布化*帕累托传递耦合各阶段;(iii)引入**假设鲁棒帕累托前沿(ARPF)**,重新采样假设——包括结构性、ε-污染错误设定——以评分每个行动存活的频率(ρ);以及(iv)当没有数据存在时,合成一个基准可信的基础(SRJANA)。我们*证明*了一个遗憾界,使ρ成为决策遗憾的精确因子,并呈现**决策可追溯性**——即哪些片段构成一个行动以及哪个约束是紧的——从而使推荐可审计,而不仅仅是具有说服力。我们通过三种方式验证了这一核心主张。在受控的结构性错误设定下,鲁棒折中方案相较于朴素点计划将均值遗憾和尾部遗憾降低了90%以上。在一个受监管的商业决策(一个面临专利到期危机的肿瘤品牌)中,我们在一个*合法*——MLR/同意/频率/KAM——行动空间内,以*处方代理*为目标进行优化,并以欧元计价下行风险。最后,在一个我们未生成的41,188个营销决策的*真实*公开数据集上,样本外回测显示,鲁棒规则相较于记录中的现状提升了34%,相较于朴素点规则提升了4%,同时可测量地减少了优化者的诅咒。所采用的求解器均为标准求解器,我们未声称基准SOTA;贡献在于不确定性类型化中间表示、ARPF及其遗憾界、分布化多阶段传递、决策可追溯性报告,以及作为决策*压力测试*层(而非记录系统)的部署姿态。一项头对头对比精确定位了LLM推理的极限:将正确数字交给LRM以及经典单目标优化,两者都产生了YUKTI鲁棒折中方案约47倍的保留遗憾——LRM是一个*表述者*,而非求解者。最后,我们展示了形式主义本身必须在何处改变:当行动之间存在长程因果耦合时,前向多阶段传递变得不可靠——其遗憾随耦合增长,逐阶段证明变得过于乐观——这标志着传递必须变为逆向归纳因果策略的边界。
## 1 引言
决策者反复提出的一个请求看似简单:"以下是我用文字描述的情境——告诉我该怎么做。"其背后隐藏着一个从未被写下的优化问题。决策者知道自己可控制的*杠杆*、关心的*信号*以及必须遵守的*限制*,但并不知道正式规划中的变量、目标和约束。近期研究已表明,语言模型可以弥合这一差距:给定一段描述,它们可以提取变量、约束和目标,并生成求解器代码[1, 3, 5]。然而,当前的表述方式在三个层面上过于狭隘,而这些问题恰恰在决策风险最高时最为关键。首先,它是*单目标*的:实际需求往往需要在覆盖范围、成本和风险之间进行权衡,将其压缩为一个加权标量会隐藏决策者实际上希望看到的权衡关系。其次,它是*一次性的*:许多决策是*顺序性的*——你首先设计一个方案,然后决定如何积极地推广它,而第二个决策受制于第一个决策的成果。第三,也是最重要的一点,它是*点值化的*:为了将"肿瘤医生对临床内容反应良好"转化为一个数字,模型必须"发明"一个系数。这个系数是一个假设,而一个仅在该假设值下最优的计划可能是脆弱的。
```
文字化决策简报 → LLM自动表述 → 点值模型(单目标)→ 单一最优 → 当假设数值错误时脆弱
文字化决策简报 → 类型化-不确定性IR + 网络锚点(SRJANA) → 结构感知路由器 → 帕累托前沿(精确/NLP/EA) → 鲁棒折中方案(带分数ρ)
上图:当前主流管线
下图:YUKTI(本工作)
```
图1:为何当LLM进入每个决策时这一点至关重要。
同样的文字化简报可以用两种方式客观化。当前主流管线(上图)承诺单一目标和点值系数,得出一个单一最优,当"发明"的数值有偏差时,该最优是悄然脆弱的。YUKTI(下图)保持目标冲突,携带每个系数的不确定性,将阶段路由到正确的求解器,并返回一个带有概率ρ(表示该方案在其自身假设下存活的概率)注释的折中方案。当自动表述大规模驱动临床、公共卫生、能源和金融资源配置时,这一鲁棒性信号就是安全阀。
**为何此问题现在至关重要。** 随着LLM从起草文本转向*做出并塑造决策*——分诊患者、分配筛查外展、设定能源补贴规模、制定商业战略——将定性简报转换为数值的步骤正在以人口规模执行,且往往不可见。每一个被客观化的系数都是一个假设;一个单目标、点值化的计划继承了所有这些假设,却未发出任何关于自身脆弱性的信号(图1,上图)。当此类计划驱动实际资源配置时,悄然的脆弱性就是失败模式。YUKTI所增加的规则——保持冲突目标明确、携带每个"发明"数值的不确定性、报告推荐方案在其自身假设下的存活频率——正是当自动表述嵌入所有地方时变得至关重要的安全阀(图1,下图)。
**两种可追溯性。** 这里的关键教训并非语言模型无法构建此类模型——一个能力足够的模型可以做到,而且这正是本论文中系统的构建方式。教训在于输出的*认识论地位*。风险是*计算的模仿*:具有优化推荐*形式*但缺乏其实质的文本——没有求解的模型、没有声明的系数、没有敏感性分析、没有鲁棒性。检索增强生成提供了*来源可追溯性*(一个事实来自何处);高风险的决策额外需要*决策可追溯性*——即能够追溯*推荐行动*如何依赖于其输入:它包含哪些片段、哪些假设会改变它、以及哪个约束是紧的。一个推荐可以具有完美的来源,但仍然可能在操作上不可靠。YUKTI直接以决策可追溯性为目标,并且§15增加了两种机制——片段归因和影子价格——从而使该属性作为输出传递,而非在叙述中声称。
**本论文。** 我们提出YUKTI¹(梵语*yukti*:合适的手段,合理的装置或策略),一个框架,它让LLM发挥其强项——阅读情境并命名其结构——但改变了表述的*目标*及背后的*机制*:
- • 一个**类型化命题IR**,其中每个定量关系是一个函数φ(x,u;θ),携带定性形状先验、其系数θ上的*分布*以及来源标签(给定/假设/基准);
- • 一个**结构感知路由器**,以数值方式探测每个阶段,并将其发送到精确、非线性或进化多目标求解器;
- • 一个**多阶段前沿传递**,在决策DAG上链接异构阶段;以及
- • **假设鲁棒帕累托前沿(ARPF)**:通过重新采样IR的系数分布并重新排序已发现的解,YUKTI为每个候选解报告其保持可行且非支配的概率,并选择一个*鲁棒*折中方案。
- • **基准锚定上下文合成(SRJANA)**:一个前端模块,当不存在数据集时,从提取的规格和网络来源的基准锚点合成一个上下文数据集,将命题拟合到该数据集,从而使系统*动态地*响应简报。
- • **决策可追溯性**:两种报告机制使推荐行动可审计——*片段归因*(哪些片段组成该行动及其优先级)和*影子价格分析*(哪个约束是紧的以及放松它的边际价值)。
- • • 一个**遗憾界**(定理1),使ρ成为池遗憾的精确因子,并在结构性(ε-污染)错误设定下依然成立,外加一个在保留的、RCT锚定的世界上的**样本外验证**,其中鲁棒折中方案相较于朴素点计划将遗憾降低了>90%。
我们有意地区分创新点与复用点(§21)。求解器是成熟的;贡献在于不确定性类型化IR、自动表述场景中的ARPF机制以及异构传递。我们未声称基准优越性;这是一个系统与方法提案,附带经过验证的端到端演示。
**路线图。** 论文分为四个部分。*第一部分*(本节、§2)提出问题并综述先前的自动表述路线。*第二部分*阐述方法:类型化不确定性IR、结构感知路由器、多阶段传递、ARPF及其遗憾界、SRJANA以及实现。*第三部分*是证据:一个实例演示、三领域展示、系统评估、决策可追溯性、错误设定下的验证、在*真实*数据上的验证以及一个受监管的部署。*第四部分*绘制边界:与LLM推理及单目标优化的头对头对比、长程因果耦合迫使形式主义改变的点、以及我们的定位、局限性和未来工作。
## 2 相关工作
**用于优化建模的LLM。** NL4Opt将自然语言到模型的转换框架设计为提取变量、约束和目标[1]。Chain-of-Experts引入了用于运筹学的多智能体推理[2]。OptiMUS和OptiMUS-0.3使循环具体化——表述、生成求解器代码、执行、调试[3,4]。ORLM在合成实例上微调开放模型并发布了IndustryOR基准[5];LLMOPT将五元素结构(集合、参数、变量、目标、约束)编码化[6];OR-LLM-Agent增加了使用推理模型的显式任务分解[7]。最新的系统强调*持久化*的中间表示和事后分析:ORPilot存储一个经过验证的JSON IR并支持假设分析查询[8];OptiRepair和OptiLoop通过求解器验证的诊断和修复来闭合循环,主张超越仅仅可行性的"操作理性"[9,10]。所有这些都将系数视为一旦获取即为固定值,并且几乎所有都针对单目标表述准确性。YUKTI继承了IR和求解器的规范,但使IR*不确定且类型化*,并使目标*多目标化且多阶段化*。
**精确多目标规划。** ε-约束方法通过优化一个目标同时约束其他目标来生成帕累托最优点[11]。AUGMECON2通过添加词典序松弛项来避免弱有效点并跳过冗余迭代,为整数规划生成精确帕累托集[12];AUGMECON-R将实用性扩展到多个目标[13]。我们在HiGHS上对仿射阶段使用增强的ε-约束生成器。
**进化多/多目标优化。** NSGA-II结合了快速非支配排序与拥挤距离[14];NSGA-III用参考方向关联代替拥挤距离以适应多个目标[15],方向由Das-Dennis单纯形构造放置[17];MOEA/D将问题分解为标量子问题[16]。我们通过pymoo[18]访问这些算法,以及其妥协规划和高等折中MCDM工具。
**不确定性下的顺序决策。** 多阶段随机规划在此处与补救决策之间在满足非预期性的场景树上建模,通过嵌套Benders/L型分解求解[21,22];等价确定性规划刻画了其结构[23,24]。YUKTI的多阶段层是一个确定性的*前沿传递*——阶段的分层耦合——而非完全补救;我们通过ARPF处理系数不确定性而非场景树,并在§22中讨论其关系。
**前沿不确定性。** 在多目标贝叶斯优化中,qEHVI和qNEHVI优化期望超体积改进,并且关键地,整合了由噪声观测引起的*帕累托前沿*中的不确定性[19,20]。ARPF是同一思想在不同来源上的迁移:它整合了由LLM获取的不确定*模型系数*所引起的前沿不确定性,而非噪声测量值。更广泛地说,鲁棒优化寻求在不确定性集合上稳定的解[25,26];ARPF是一个基于采样、前沿级别的实例,专门针对自动表述的命题。
---
**第二部分 | YUKTI方法**
## 3 YUKTI框架
(图2的标题:YUKTI管线。一个文字化情境被提取为杠杆、信号、约束和一个阶段DAG;每个关系被*客观化*为一个类型化命题,带有不确定性分布;阶段被路由到精确、NLP或进化求解器;通过跨阶段的帕累托*传递*求解;通过重新采样假设(ARPF)进行鲁棒化;并整合为推荐、带鲁棒性评分的折中方案。)
一个问题是一个有向无环图,包含按拓扑顺序排列的*阶段* S = {s₁, ..., s_T}。每个阶段相似文章
知识图谱中的可扩展不确定性推理
本论文提出了一个模块化框架,用于知识图谱中的可扩展不确定性推理,通过定制的代数、逻辑和几何技术,处理不精确的属性值、概率性三元组存在以及不完整的模式知识。
通过不确定性对齐的强化学习探索智能体工具调用决策
本文提出TRUST方法,将不确定性量化融入强化学习奖励设计,以改进LLM智能体的工具调用决策,提升决策质量并保持可靠的不确定性估计。
打破概率的枷锁:Neutrosophic Logic作为大语言模型中认知不确定性的新框架
本文研究了Neutrosophic Logic作为大语言模型中认知状态建模的框架,证明了它能够捕捉超越传统概率约束的'hyper-truth'状态,从而带来更透明、更具伦理意识的AI系统。
立场论文:决策引擎中的求解后鲁棒性:扰动下的可行区域与平滑性
立场论文:主张为MILP决策引擎增加一个求解后鲁棒性层,形式化扰动下的可行邻域和解的平滑性,并呼吁采用经过认证的内部近似和对抗鲁棒性裕度。
你确定吗?符号回归中不确定性量化的全面且易懂综述
关于符号回归中不确定性量化的全面综述,回顾了频率学派、贝叶斯以及模型选择方法,以解决在现实决策过程中缺乏可靠性支持的问题。