决策中的弱到强学习

arXiv cs.LG 论文

摘要

本文提出了一种决策感知的弱到强(W2S)学习框架,该框架利用有限的标注数据训练一个弱模型,然后由该模型在未标注数据上生成软监督信号,用于训练一个强模型,以改进上下文随机优化。理论界限和实证实验表明,当弱特征表示与强特征表示之间的相关性较小时,大量未标注数据能够降低下游决策风险。

arXiv:2607.18467v1 公告类型:新 摘要:许多运营决策依赖于预测模型,这些模型根据可观测的上下文估计不确定的结果。然而,训练此类模型通常面临一个根本性的数据不对称问题:标注结果稀缺或获取成本高,而上下文协变量却非常丰富。受这一数据不对称问题的启发,我们开发了一个决策感知的弱到强(W2S)框架,利用标注和未标注数据来改进上下文随机优化。具体而言,我们首先使用有限的标注数据训练一个弱模型,然后利用该模型在未标注的上下文上生成预测的结果分布。这些分布为训练强模型提供软监督。我们建立了W2S超额决策风险的非渐近上界,以及仅用强模型基准的互补下界。通过比较,得出了W2S能够改善下游决策性能的明确充分条件。关键量是弱特征表示与强特征表示之间的相关维数:当该维数较小时,大量未标注数据会沿着非重叠方向减少教师错误的影响。基于合成报童实验和真实世界数据的评论审核实验提供了与理论一致的实证证据。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:21

# 1 引言 来源:https://arxiv.org/html/2607.18467 \\OneAndAHalfSpacedXI\\TheoremsNumberedThrough\\ECRepeatTheorems\\EquationsNumberedThrough \\RUNAUTHOR \\RUNTITLE \\TITLE 决策中的弱到强学习 \\ARTICLEAUTHORS\\AUTHOR 计经纬\\AFF管理科学与工程,斯坦福大学,\\EMAILjingwei\.ji@stanford\.edu\\AUTHOR许仁远\\AFF管理科学与工程,斯坦福大学,\\EMAILrenyuanxu@stanford\.edu \\ABSTRACT 许多运营决策依赖于预测模型,这些模型根据可观测的上下文估计不确定的结果。然而,训练这类模型常常面临一个根本性的数据不对称问题:标记结果稀缺或获取成本高昂,而上下文协变量却非常丰富。受这种数据不对称的启发,我们开发了一个决策感知的弱到强(W2S)框架,利用标记数据和未标记数据来改进上下文随机优化。具体来说,我们首先使用有限的标记数据训练一个弱模型,然后用它生成未标记上下文上的预测结果分布。这些分布为训练强模型提供了软监督。我们建立了W2S超额决策风险的非渐近上界,并为纯强模型基准建立了互补的下界。两者的比较给出了明确充分条件,说明W2S在何种情况下能够提升下游决策性能。关键量是弱特征表示与强特征表示之间的相关维数:当该维数较小时,大量的未标记数据可以降低教师错误在非重叠方向上的影响。基于合成数据和真实世界评论审核实验的实证证据与该理论一致。 \\KEYWORDS 弱到强;上下文随机优化

许多运营决策依赖于预测模型,这些模型根据可观测的上下文估计不确定的结果。示例包括库存规划与上下文需求预测的报童问题(Ban and Rudin 2019 (https://arxiv.org/html/2607.18467#bib.bib2), Chang et al. 2025 (https://arxiv.org/html/2607.18467#bib.bib12), Chen et al. 2021 (https://arxiv.org/html/2607.18467#bib.bib15));动态定价、收益管理、在线零售定价以及联合定价-库存学习与需求预测(Cohen et al. 2020 (https://arxiv.org/html/2607.18467#bib.bib18), Javanmard et al. 2024 (https://arxiv.org/html/2607.18467#bib.bib36), Ferreira et al. 2016 (https://arxiv.org/html/2607.18467#bib.bib27), Chen et al. 2026 (https://arxiv.org/html/2607.18467#bib.bib17),2022 (https://arxiv.org/html/2607.18467#bib.bib16));基于旅行时间估计的路径规划(Guo et al. 2023 (https://arxiv.org/html/2607.18467#bib.bib31));以及基于收益分布建模的投资组合分配(Gu et al. 2020 (https://arxiv.org/html/2607.18467#bib.bib30))。相关公式也出现在数据驱动鲁棒优化和离线策略学习中(Wang et al. 2016 (https://arxiv.org/html/2607.18467#bib.bib62), Zhou et al. 2023 (https://arxiv.org/html/2607.18467#bib.bib71));参见 Bastani et al. (2022 (https://arxiv.org/html/2607.18467#bib.bib3)) 关于运营管理中机器学习的综述。这些场景可以统一视为上下文随机优化的实例。

当预测结果作为运营决策的输入时,越来越多的文献认识到模型训练应考虑这些预测将用于的优化问题。关键见解很简单:仅靠预测准确性并不能保证决策质量。在标准统计损失下看似微小的错误,如果扭曲了决策关键方向,可能会引发巨大的下游成本。这一观察催生了决策感知(Elmachtoub and Grigas 2022 (https://arxiv.org/html/2607.18467#bib.bib24))和集成学习框架(Qi et al. 2025 (https://arxiv.org/html/2607.18467#bib.bib51)),它们明确地将预测训练与运营目标对齐。在这项工作中,我们采用了 Qi et al. (2025 (https://arxiv.org/html/2607.18467#bib.bib51)) 提出的集成条件估计-优化(ICEO)框架。

然而,一个日益常见的实际挑战超出了标准公式的范畴,该公式假设有足够多的标记结果。在许多应用中,标记结果稀缺和/或成本高昂,而上下文协变量丰富。与此同时,实践者通常可以访问不同强度的多个模型或特征表示。例如,他们可能有一个较小的模型,可以在有限的标记数据上可靠训练,以及一个更大的模型,表达能力更强但需要更多计算资源进行训练。这引出了我们旨在严格回答的一个自然问题:我们能否利用在有限标记数据上训练的弱模型,借助大量未标记数据来指导更强模型的训练,从而改进上下文随机优化中的下游决策性能?

我们通过一个针对下游决策问题的弱到强学习框架来回答这个问题。弱模型首先使用标记数据进行适应,然后用于在未标记上下文上生成预测结果分布。这些预测分布作为训练强模型的软监督。由此产生的强模型诱导出一个插入式决策策略,其性能通过下游决策风险而非预测损失来评估。我们专注于一个标签稀缺的场景:弱模型在适应后包含有用的任务相关信号,而强模型虽然表达性强,但仅靠有限的标记数据难以可靠训练。在这种场景中,大量的未标记上下文为知识迁移创造了机会:弱模型可以在许多上下文上提供任务特定的监督,强模型可以利用这种监督来学习更好的决策策略。这种场景出现在现代决策应用中,其中决策相关结果成本高昂、有延迟、被审查或仅在历史策略下可观测,包括个性化定价与推荐、医疗治疗决策、车辆路径规划和库存控制(Shi et al. 2016 (https://arxiv.org/html/2607.18467#bib.bib55), Zhan et al. 2023 (https://arxiv.org/html/2607.18467#bib.bib68), Cao 2025 (https://arxiv.org/html/2607.18467#bib.bib10), Keyvanshokooh et al. 2025 (https://arxiv.org/html/2607.18467#bib.bib39), Serrano et al. 2026 (https://arxiv.org/html/2607.18467#bib.bib54))。类似的弱到强过程已被证明能让强模型在预测场景(包括分类和语言建模)中超越其弱监督者(Burns et al. 2024 (https://arxiv.org/html/2607.18467#bib.bib8), Dong et al. 2025 (https://arxiv.org/html/2607.18467#bib.bib21))。这种现象能否被迁移到下游决策问题中——其中性能通过决策风险而非预测损失来衡量——仍然是一个开放问题。

### 1.1 我们的贡献

我们总结贡献如下:

1.  1\. 决策中的弱到强(W2S)公式。现有的W2S理论主要关注分类和回归等预测目标(Burns et al. 2024 (https://arxiv.org/html/2607.18467#bib.bib8), Dong et al. 2025 (https://arxiv.org/html/2607.18467#bib.bib21), Lang et al. 2024 (https://arxiv.org/html/2607.18467#bib.bib42), Charikar et al. 2024 (https://arxiv.org/html/2607.18467#bib.bib13)),对于W2S是否以及何时能改进决策问题仍不明确。我们将W2S范式扩展到下游决策问题,在上下文随机优化中构建弱到强迁移。在我们的公式中,弱模型不仅提供用于预测的伪标签;相反,它在未标记上下文上生成不确定结果的伪分布,然后用这些分布训练一个更强模型,其价值通过其诱导插入式策略的决策风险来衡量。这为研究弱监督何时能改进运营决策提供了一个决策理论的建模框架,并为将W2S分析扩展到更丰富的决策场景(如序列决策和强化学习)奠定了基础。
2.  2\. 算法及其理论理解。基于这一公式,我们开发并分析了一个决策感知的W2S训练算法。我们在定理3.1 (https://arxiv.org/html/2607.18467#S3.Thmtheorem1)中证明了W2S策略超额决策风险的非渐近上界。通过将该界与直接在标记数据上训练的纯强模型基准进行比较,我们在推论4.3 (https://arxiv.org/html/2607.18467#S4.Thmtheorem3)中获得了W2S何时改进下游决策性能的明确认证。比较揭示了一个关键的结构性机制:当弱表示和强表示之间的重叠有限时,W2S最有利,这样弱教师产生的错误不太可能系统地与强模型使用的方向对齐。在这种情况下,大量的未标记上下文可以稀释教师错误,而不是简单地将它们转移到强模型。
3.  3\. 实证证据。我们用两个实证研究来补充理论。首先,我们使用受控的合成实验来测试理论预测的场景是否能在模拟中观察到。然后,我们在一个真实世界的评论审核任务上评估W2S,其中预测指导自动和人工审核的审核决策。在两个研究中,定性模式与理论一致:当标记数据稀缺且未标记上下文丰富时,W2S带来最大的收益,并且随着标签积累,这些收益会缩小。

这种数据不对称在运筹学中普遍存在:上下文信息通常可以大规模获得,而可靠的结果标签稀缺、有延迟或受历史决策影响,例如库存和定价中的实际需求,或路径规划中的旅行时间不确定性(Ban and Rudin 2019 (https://arxiv.org/html/2607.18467#bib.bib2), Cohen et al. 2020 (https://arxiv.org/html/2607.18467#bib.bib18), Guo et al. 2023 (https://arxiv.org/html/2607.18467#bib.bib31))。本文开发的弱到强框架是利用这种不对称性进行下游决策的第一步。它使用稀缺的标记结果从弱决策感知模型中提取任务特定信号,并将该信号跨大量未标记上下文迁移以调整更强模型,这为更广泛的标签受限决策问题提供了一条有前景的途径。

### 1.2 相关文献

我们的工作推动了多个研究方向的进展。

##### 上下文优化。近年来,运筹学领域对上下文随机优化的兴趣激增。这一研究方向研究如何将预测模型与优化方法结合起来,以改进不确定性下的决策。综述论文(Sadana et al. 2025 (https://arxiv.org/html/2607.18467#bib.bib52))对该主题的文献进行了全面回顾,并将现有工作分为三大类:决策规则优化(Donti et al. 2017 (https://arxiv.org/html/2607.18467#bib.bib22), Zhang and Gao 2017 (https://arxiv.org/html/2607.18467#bib.bib70), Ban and Rudin 2019 (https://arxiv.org/html/2607.18467#bib.bib2), Bertsimas and Koduri 2022 (https://arxiv.org/html/2607.18467#bib.bib5), Huber et al. 2019 (https://arxiv.org/html/2607.18467#bib.bib34))、序列学习与优化(Deng and Sen 2022 (https://arxiv.org/html/2607.18467#bib.bib19), Wang et al. 2026 (https://arxiv.org/html/2607.18467#bib.bib61))以及集成学习与优化(Elmachtoub and Grigas 2022 (https://arxiv.org/html/2607.18467#bib.bib24), Qi et al. 2025 (https://arxiv.org/html/2607.18467#bib.bib51), Loke et al. 2020 (https://arxiv.org/html/2607.18467#bib.bib47))。我们的工作属于第三类。Elmachtoub and Grigas (2022 (https://arxiv.org/html/2607.18467#bib.bib24)) 引入了SPO/SPO+框架,并正式提出仅预测准确性与下游决策质量可能错位。El Balghiti et al. (2019 (https://arxiv.org/html/2607.18467#bib.bib23)) 通过建立决策感知学习的样本外保证补充了这一研究方向,而Elmachtoub et al. (2020 (https://arxiv.org/html/2607.18467#bib.bib25)) 开发了直接为优化性能训练的可解释决策树。最近,Elmachtoub et al. (2023 (https://arxiv.org/html/2607.18467#bib.bib26)) 比较了先估计后优化、集成估计优化和样本平均近似,有助于澄清这些范式的相对优势。在这些工作中,Qi et al. (2025 (https://arxiv.org/html/2607.18467#bib.bib51)) 与我们最为接近。他们提出了集成条件估计-优化框架,该框架学习不确定结果的条件分布,并通过诱导插入式策略的下游决策风险来评估其性能。他们证明该框架具有良好的统计保证。我们的论文建立在这一视角上,研究当标记数据稀缺但未标记上下文丰富时,如何融入弱到强训练流程。感兴趣的读者还可参考综述论文 Qi and Shen (2022 (https://arxiv.org/html/2607.18467#bib.bib50)) 和 Sadana et al. (2025 (https://arxiv.org/html/2607.18467#bib.bib52))。

##### 弱到强泛化。Burns et al. (2024 (https://arxiv.org/html/2607.18467#bib.bib8)) 首次将弱到强泛化形式化为一种经验现象:一个强大的预训练模型,在由更弱模型生成的标签上微调后,可以在多项任务(NLP基准测试、国际象棋谜题和奖励建模)中超越其弱监督者。Lang et al. (2025 (https://arxiv.org/html/2607.18467#bib.bib41)) 表明,辩论阶段——强模型生成竞争性答案,弱监督者从中选择——可以提高伪标签质量。有趣的是,Goel et al. (2025 (https://arxiv.org/html/2607.18467#bib.bib28)) 发现,随着模型能力增强,它们会犯越来越相关的错误,这可能削弱W2S训练的好处,并对AI监督构成风险,因为相似模型的互补知识较少可迁移。还有一系列工作专注于W2S泛化的理论理解。我们的工作采用了 Dong et al. (2025 (https://arxiv.org/html/2607.18467#bib.bib21)) 和 Liu et al. (2026 (https://arxiv.org/html/2607.18467#bib.bib45)) 的视角。他们提出了一个基于差异的框架来分析W2S泛化现象。他们发现W2S收益源于低维微调中的方差减少。当教师和学生依赖不同的特征方向时,教师的错误对学生而言就像噪音,并可以通过大量伪标签平均掉。因此,适度的差异可以改善W2S。Charikar et al. (2024 (https://arxiv.org/html/2607.18467#bib.bib13)) 也提供了相关的直觉,他们证明W2S的收益来自于弱模型与强模型之间的不匹配,即强模型的错误知识并非继承自弱模型。其他理论解释包括 Lang et al. (2024 (https://arxiv.org/html/2607.18467#bib.bib42)),他们更侧重于几何视角。他们表明,在数据图的扩展条件(Cai et al. 2021 (https://arxiv.org/html/2607.18467#bib.bib9))下,任何在伪标签上达到低训练错误的学生分类器,

相似文章

Weak-to-Strong On-Policy Distillation

arXiv cs.LG

介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。

弱链优化:多智能体推理与协作框架

arXiv cs.CL

本论文提出WORC框架,这是一个针对多智能体LLM系统的弱链优化框架,通过基于元学习的权重预测和不确定性驱动的资源分配来识别并强化表现不佳的智能体,在推理基准上达到82.2%的准确率,同时提升了系统稳定性。

学习对未观测混杂因素鲁棒的风险评分

arXiv cs.LG

本文提出了一种从观测数据中学习风险评分的方法,该方法对未观测混杂因素具有鲁棒性,采用敏感性分析和Wasserstein分布鲁棒优化。该方法在传统基准和最先进方法上提高了校准性。