Sim2Schedule:一种模拟器引导的LLM框架,用于自主露天矿调度
摘要
本文介绍Sim2Schedule,一种由模拟器引导的LLM框架,用于自主露天矿调度。该框架在计算时间线性扩展的情况下,能达到MILP最优净现值的94%-99%,且无需微调即可零样本运行。
arXiv:2606.10286v1 Announce Type: new
摘要:露天矿调度是在复杂的地质和运营约束下最大化经济效益的关键过程。虽然混合整数线性规划(MILP)提供了数学上的最优基线,但其指数级的计算复杂性和无法实时适应的特性限制了其在动态工业环境中的实际部署。本研究引入了一个由模拟器驱动的大型语言模型(LLM)调度框架,其中LLM充当自主决策代理,每一步都由一个定制模拟器引导,该模拟器将地质优先关系、采选耦合和动态容量约束直接编码到动作生成机制中。该框架在封闭、数据安全的环境中完全零样本运行,无需基于云的推理、领域特定的微调或重新训练,即可生成完整、可解释的采选计划。为了提供可靠的性能基准,本文开发了一种新颖的MILP公式,该公式融入了实际运营和地质约束。在跨不同规模和时间段的采矿实例上进行评估,基于LLM的框架恢复了MILP最优NPV的94\%到99\%,同时计算时间呈线性扩展。这些结果表明,在复杂运营约束下的长期工业调度中,模拟器约束的LLM代理是经典优化的实用且可扩展的替代方案。
查看缓存全文
缓存时间: 2026/06/10 06:13
# Sim2Schedule: 一种基于模拟器引导的大型语言模型框架,用于自主露天矿调度 来源:https://arxiv.org/html/2606.10286 Thiago Eustaquio Alves de Oliveira [email protected] (mailto:[email protected]) 0000-0002-7164-9064 (https://orcid.org/0000-0002-7164-9064) Lakehead大学计算机科学系,桑德贝,安大略省,加拿大 以及 Mahzabeen Emu 0000-0002-0433-1873 (https://orcid.org/0000-0002-0433-1873) [email protected] (mailto:[email protected]) 纽芬兰纪念大学量子通信与计算研究中心及电气与计算机工程系,圣约翰斯,纽芬兰省,加拿大 (2026) ###### 摘要 露天矿调度是在复杂地质与运营约束下最大化经济回报的关键过程。虽然混合整数线性规划(MILP)提供了数学上的最优基线,但其指数级计算复杂度以及无法实时适应动态工业环境的局限性,限制了其在实际中的部署。本文提出了一种模拟器驱动的大型语言模型(LLM)调度框架。在该框架中,LLM充当自主决策代理,在每一步均由一个定制的模拟器引导。该模拟器将地质优先关系、开采-处理耦合以及动态容量约束直接编码到动作生成机制中。该框架完全以零样本方式在封闭、数据安全的环境中运行,无需云端推理、领域特定的微调或重新训练,即可生成完整、可解释的开采与处理调度方案。为了提供可信的性能基准,本文还开发了一种新颖的MILP公式,该公式纳入了实际运营与地质约束。在规模各异、时间跨度不同的采矿实例上进行评估后,该基于LLM的框架能够恢复MILP最优净现值(NPV)的94%至99%,同时计算时间呈线性增长。这些结果表明,受模拟器约束的LLM代理作为一种实用且可扩展的替代方案,能够有效应对复杂运营约束下的长周期工业调度问题。 大型语言模型,生产调度,模拟,混合整数线性规划,优化,露天采矿 ††copyright:acmlicensed ††journalyear:2026 ††doi:XXXXXXX.XXXXXXX ††journal:taas ††ccs:计算方法 自然语言生成 ††ccs:计算方法 确定性动作规划 ††ccs:数学计算 组合优化 ## 1. 引言 通过露天采矿开采近地表矿床是一个复杂的工业过程。它涉及系统地移除水平台阶以获取有价值的矿物。该方法需要谨慎且持续地平衡两方面工作:选择性开采矿石进行加工,以及管理大量废料(即覆盖层)。这些废料必须被移除,以确保边坡稳定性并接触更深层的资源(Altiti et al., 2021 (https://arxiv.org/html/2606.10286#bib.bib1))。这些运营的经济性取决于一个两部分结构:开采活动构成主要运营成本,而加工活动则将原矿石精炼成适销产品并产生收入(Amponsah et al., 2022 (https://arxiv.org/html/2606.10286#bib.bib3))。确定这些活动的最有利顺序被称为露天矿生产调度(OPPS)。它是确保资本密集型采矿项目长期经济可持续性的关键因素(Meagher et al., 2014 (https://arxiv.org/html/2606.10286#bib.bib2))。核心目标是通过优化每个块体的开采时机,最大化运营的净现值(NPV),并应对一个基本的经济权衡:挖掘覆盖层会产生即时成本,但这是暴露深层高品位矿石所必须的先决条件(Saavedra-Rosas et al., 2016 (https://arxiv.org/html/2606.10286#bib.bib30))。因此,这一序列的空间与时间优化是OPPS的主要挑战。 随着大型语言模型(LLMs)成为人工智能领域的革命性方法,它们做出可解释决策和进行上下文推理的能力,除了处理自然语言任务外,也引起了人们的兴趣(Li et al., 2024 (https://arxiv.org/html/2606.10286#bib.bib38))。具体到矿山规划领域,近期的研究探索了数据驱动和AI辅助的运营调度方法,包括短周期卡车调度和任务排序(Icarte-Ahumada and Herzog, 2025 (https://arxiv.org/html/2606.10286#bib.bib32)),然而,将LLM应用于块体开采与排序这一长周期战略问题仍属空白。这一空白意义重大,因为LLM提供了实时适应性和零样本泛化能力,当运营条件发生变化时,可以显著减轻专家重新优化的负担(Bubeck et al., 2023 (https://arxiv.org/html/2606.10286#bib.bib14); Da Ros et al., 2026 (https://arxiv.org/html/2606.10286#bib.bib15); Yang et al., 2024 (https://arxiv.org/html/2606.10286#bib.bib16))。 将LLM部署于矿山调度也带来了实际挑战。LLM在训练和推理过程中需要大量的计算和存储资源(Wang et al., 2025a (https://arxiv.org/html/2606.10286#bib.bib39)),这在资源受限的工业环境中是一个重大负担。如果LLM仅用于推理,而不进行任何领域特定的微调,则计算开销会显著降低。这一观察启发了本文的核心贡献:我们引入了一个框架,其中LLM仅作为推理时的决策者,在每一步都由一个定制模拟器引导,该模拟器直接将领域知识编码进决策过程。如图1 (https://arxiv.org/html/2606.10286#S1.F1) 所示,模拟器充当媒介,将矿山状态信息传递给LLM,并接收和记录其决策。在每个调度步骤中,模拟器评估当前的开采状态,并识别所有物理上可行的动作。这些动作随后以结构化上下文的形式呈现给LLM。一旦LLM选择一个动作,模拟器便处理该决策并相应推进矿山状态。这样就生成了完整的开采与处理调度方案,整个过程无需任何LLM训练、微调或适应。该框架作为一个封闭、自包含的系统运行,无需云端LLM调用,确保敏感的矿山数据保留在运营环境内部。 参见图标题 图1. LLM辅助调度框架概览 所提出的基于LLM的露天矿开采调度模拟框架概览图。 考虑到OPPS的计算复杂性,混合整数线性规划(MILP)历来占据主导优化范式的地位,它能够形式化地整合经济、技术和运营约束。然而,现有的MILP公式常常忽略安全移除深层开采上覆岩石的必要性,允许对部分掩埋材料进行数学处理,并施加僵化的产能目标,这些目标随着矿山资源枯竭而变得不可行。为了解决这些缺陷,本文引入了一种新颖的MILP公式,明确强制这些物理现实,从而生成真正可执行的调度方案。虽然这提高了运营现实性,但由此产生的公式规模庞大且求解计算成本高昂,每当出现新的运营变化时都需要专家重新进行公式化,并且生成的序列需要后处理才能被矿山规划人员理解。这些局限性促使我们需要一种调度框架,能够在数学严谨性与实时适应性和可解释性之间取得平衡。虽然元启发式算法和强化学习已被探索用于此目的,但它们在不同采矿场景中往往难以实现泛化性和透明推理(Zajac, 2025 (https://arxiv.org/html/2606.10286#bib.bib17))。本文提出的LLM驱动模拟器框架通过提供一个连续的、可解释的决策过程来解决这些不足,该过程能够适应运营变化而无需重新优化。本研究中,MILP公式并非作为提出的解决方案,而是作为最优基准,与贪心启发式算法和随机基线一起用于评估LLM代理,从而系统性地评估LLM驱动的调度能否有效驾驭计算可处理性与解质量之间的权衡。 本研究的主要贡献如下: - **基于LLM的长期OPPS采矿代理**:设计了一个自主调度框架,其中LLM充当决策代理。与静态求解器不同,该代理通过在每个时间步评估不断变化的可行动作集,动态生成开采处理序列。与仅限于短周期运营任务(如卡车调度)的先前采矿AI不同(Icarte-Ahumada and Herzog, 2025 (https://arxiv.org/html/2606.10286#bib.bib32)),我们的代理处理的是多周期、战略性的块体开采与加工排序问题,以最大化NPV。LLM在定制模拟器内以零样本方式运行,无需领域特定训练,即可生成立即可解释、可执行的调度方案。 - **可解释、开源的采矿模拟器**:开发了一个交互式露天矿调度模拟器,据我们所知,这是首个与LLM代理集成的此类模拟器。该模拟器评估可行动作、处理决策并实时更新系统状态。至关重要的是,它生成的决策序列是透明的,并且矿山规划人员可以立即解释,便于运营验证。该模拟器已公开发布,以支持可重复性和进一步的方法论开发。¹¹¹模拟工具可在以下网址获取:https://anonymous.4open.science/r/LLM-MILP-Mining-DF4E - **针对现实约束的MILP公式**:开发了一个稳健的MILP模型,以解决传统调度中的关键过度简化问题。先前的公式依赖僵化的产能限制和物理上不可能的部分处理,从而产生看似最优但在地质技术上无效的调度方案。我们的方法整合了动态产能边界、严格的安全空间优先关系以及精确的开采-处理耦合。通过将这些现实约束与标准生产和品位混合要求相结合,该公式生成的NPV最大化最优方案在数学上合理且真正可执行。 本文的其余部分组织如下:第2节 (https://arxiv.org/html/2606.10286#S2) 回顾相关文献,第3节 (https://arxiv.org/html/2606.10286#S3) 介绍我们提出的框架和方法,第4节 (https://arxiv.org/html/2606.10286#S4) 详细说明实验设置、数据配置和比较评估结果。最后,第5节 (https://arxiv.org/html/2606.10286#S5) 总结主要发现并结束本研究。 ## 2. 文献综述 OPPS是矿山规划中最具挑战性的优化问题之一,它被定义为确定从矿山中开采块体的最佳时间和顺序的过程,以在满足物理、环境、运营和经济约束的前提下最大化NPV(Caccetta and Hill, 2003 (https://arxiv.org/html/2606.10286#bib.bib31))。 ### 2.1. 数学规划方法 早期基础由Lerchs等人(Lerchs and Grossmann, 1965 (https://arxiv.org/html/2606.10286#bib.bib21)) 奠定,他们利用图论方法革新了最终坑底的定义;Johnson (Johnson, 1968 (https://arxiv.org/html/2606.10286#bib.bib4)) 则使用线性规划(LP)建立了OPPS的分析基础。然而,早期的LP模型常常产生分数块体开采,需要通过启发式后处理来生成可执行的调度方案。向MILP的转变通过强制使用离散决策变量解决了这一问题,使其成为主导范式。Askari-Nasab等人(Askari-Nasab et al., 2011 (https://arxiv.org/html/2606.10286#bib.bib5)) 通过聚类和采掘单元聚合推进了这一方向,同时提高了计算可处理性和NPV。尽管有这些改进,标准的MILP公式通常依赖松弛的优先关系结构和静态的开采极限以保持可解性,这降低了其运营现实性。 随后的工作试图解决特定的运营约束。Khazaei等人(Khazaei and Pourrahimian, 2024 (https://arxiv.org/html/2606.10286#bib.bib6)) 为阶段崩落法引入了垂直和水平优先关系,但其公式缺乏严格的开采-处理耦合。Rahnema等人(Rahnema et al., 2025 (https://arxiv.org/html/2606.10286#bib.bib7)) 将温室气体排放和碳税惩罚整合进一个确定性MILP,表明环境因素可以在不改变核心结构的情况下被纳入,但简化的排序逻辑和固定阈值限制了动态一致性。Tabe sh等人(Tabesh et al., 2023 (https://arxiv.org/html/2606.10286#bib.bib8)) 引入了一个两阶段聚类框架,提高了可处理性并稳定了给矿质量,但保留了不对矿山状态时间变化做出响应的非自适应约束。 随机扩展也被探索以应对品位不确定性,对整个采矿综合体进行同时优化已显示出在地质变异性下NPV的提升(Dimitrakopoulos and Lamghari, 2022 (https://arxiv.org/html/2606.10286#bib.bib26)),尽管这些方法保留了与确定性模型相同的计算可扩展性限制。 为了克服精确求解器在大规模实例上的难解性,元启发式替代方案已被探索。Amponsah等人(Amponsah et al., 2022 (https://arxiv.org/html/2606.10286#bib.bib3)) 在品位不确定性下比较了一个遗传算法框架与一个随机MILP,显示出显著减少运行时间,但代价是牺牲了严格的优益性。Hussain等人(Hussain et al., 2024 (https://arxiv.org/html/2606.10286#bib.bib9)) 在采矿领域之外展示了MILP可以处理复杂的多周期物理和严格的约束耦合,但在矿山规划中,等效的动态一致性仍然难以实现。总的来说,这些方法共享一个基本局限性:它们作为静态、批处理的计算引擎运行,每当运营条件发生变化时,都需要专家重新进行公式化。 ### 2.2. 基于LLM与模拟驱动的方法 LLM最近已成为组合优化的强大引擎,提供了与精确求解器和元启发式算法性质不同的方法。近期工作表明,LLM可以作为NP难组合问题的端到端求解器,具有可行性感知的模型在基准实例上实现了低至1.03%的最优性差距(Jiang et al., 2025 (https://arxiv.org/html/2606.10286#bib.bib28))。StarJob框架(Abgaryan et al., 2025 (https://arxiv.org/html/2606.10286#bib.bib18)) 在作业车间调度中验证了这一潜力,其中微调后的LLM优于传统调度规则。在物流领域,结合LLM的智能体框架(Zhang et al., 2025 (https://arxiv.org/html/2606.10286#bib.bib19))
相似文章
利用LP2Graph进行LP挖掘:铁路重新调度的一个用例
本文介绍了利用LP2Graph进行LP挖掘的方法,该方法通过类型化变量-方程图从文献中提取LP和MILP公式并将其分类为可复现的数据集,并以铁路重新调度为例进行了展示。
面向AV2 2026场景挖掘挑战赛的AutoMine解决方案
AutoMine是一种强大的自优化场景挖掘方法,利用LLM和VLM从自动驾驶日志中挖掘高价值场景,在CVPR 2026的Argoverse 2场景挖掘竞赛中取得了最高分数。
在地质、需求与定价不确定性下优化锂生产决策:面向多目标决策的POMDP框架
本文提出了一种面向锂生产多目标决策的POMDP框架,处理地质、需求与定价不确定性,以优化矿山开采及提取方法选择。该方法通过信念状态规划动态适应价格机制变化,优于基于人类启发式的方法。
LLM服务中多目标路由的在线线性规划
本文提出了一种用于LLM服务路由的多目标优化框架,采用带出价-价格控制的在线线性规划来平衡延迟、吞吐量和尾部性能,并通过Vidur模拟器展示了相对于启发式方法的改进。
自主实验室编排器的最优资源利用
本文提出了一种两步法,用于优化自主实验室中的资源利用率,该方法使用约束规划进行调度,并利用状态依赖关系实现稳健执行,并在金属有机框架合成平台上进行了演示。