RACL:用于连续元启发式学习的推理智能体控制层
摘要
介绍了RACL,一种推理智能体控制层,通过学习从操作内存控制内部搜索行为来改进元启发式优化,在车辆路径测试中显示出成本改善。
arXiv:2606.20142v1 公告类型:新
摘要:本文介绍了RACL,一种针对元启发式算法的推理智能体控制层。RACL在现有优化器之上放置一个推理智能体。该智能体不替代优化器,也不修改业务约束。相反,它通过观察操作内存、推理过去行为、制定有界假设、测试干预措施、评估结果、应用防护栏、整合有用策略并解释其决策来控制优化器的内部搜索行为。实验以车辆路径问题作为测试平台,但贡献不在于新的路径求解器、特定的ALNS配置或一组特定的路径规则。贡献在于RACL方法:一种让推理智能体发现、验证、整合和解释元启发式算法控制规则的方式。在当前实验设置中,RACL在21个可行案例中的21个中改进或持平了操作内存策略,在21个可行案例中的18个中改进或持平了无推理的停滞触发策略,RACL与STP的平均成本差值为-0.641%。在Sevilla-9/10运行时样本中,RACL相对于固定策略平均成本改进-8.337%,相对于STP改进-1.605%,且未显示出明显的计算开销。在概念验证期间,Codex被用作循环中的推理智能体,观察执行、解释日志并提出实时有界干预。后来策略代理仅用于使定量评估可重复。
查看缓存全文
缓存时间: 2026/06/20 14:35
# RACL: 面向连续元启发式学习的推理智能体控制层 来源:https://arxiv.org/html/2606.20142 ###### 摘要 元启发式优化广泛应用于运营决策系统,但有效的长期应用通常需要内部缺乏的专业知识。公司可能拥有一个配置好的优化器,却缺乏随着运营经验积累而调整其内部搜索行为所需的优化专业能力。 本文提出RACL,一种面向元启发式的**推理智能体控制层**。RACL在现有优化器之上放置一个推理智能体。该智能体不替代优化器,也不修改业务约束。相反,它通过观察操作记忆、对过往行为进行推理、制定有界假设、测试干预措施、评估结果、应用防护措施、整合有效策略并解释其决策,来学习如何控制优化器的内部搜索行为。 实验以车辆路径规划为测试平台,但贡献并非一个新的路径求解器、特定的ALNS配置或一组特定的路径规则。贡献在于RACL方法本身:一种推理智能体发现、验证、整合和解释元启发式算法控制规则的方法。 在当前实验设置中,RACL在21个可行案例中的21个上改进或持平了操作记忆策略,在21个可行案例中的18个上改进或持平了非推理的停滞触发策略,RACL与STP的平均成本差为-0.641%。在Sevilla-9/10运行时样本中,与固定策略相比,RACL平均成本改善-8.337%,与STP相比改善-1.605%,且未显示实质性计算开销。 在概念验证阶段,Codex被用作循环中的推理智能体,观察执行过程、解释日志并提出实时的有界干预。后续仅使用策略代理来确保定量评估的可重复性。结果支持核心主张:推理智能体可以作为元启发式的连续控制学习层,在不接管业务约束所有权的情况下,生成有用且可解释的算法控制行为。 ## 1 引言 许多运营优化系统在类似情境中被重复使用。物流是一个明显的例子:公司可能每天都在同一地理区域解决路径问题,需求变化但运营结构具有重复性。在这种情况下,元启发式算法颇具吸引力,因为它们能在复杂约束下(此时精确优化可能不切实际)产生良好解。 然而,拥有优化器与随时间改进优化器之间仍存在差距。在许多部署中,优化引擎一次性配置后便被重复使用。客户定义业务约束,如车队可用性、配送优先级、时间限制和服务规则,但可能缺乏优化专家来在性能停滞或运营中出现重复模式时持续调整元启发式的内部行为。 本文通过提出RACL(推理智能体控制层)来解决这一差距。RACL在现有元启发式算法之上放置一个推理智能体。该智能体观察操作记忆、推理搜索行为、提出有界算法干预、评估其效果、应用防护措施并整合有效策略。智能体不改变业务约束。其角色更狭窄且更技术性:它控制元启发式的搜索方式。 其激励场景是一家公司在没有内部优化专家的情况下重复解决类似的优化问题。在这种情况下,每次执行都成为证据。RACL将积累的操作记忆转化为持续算法改进的资源。 本文提出一个由记忆指导的推理循环: 操作记忆 → 推理 → 假设 → 有界实验 → 防护措施 → 策略整合 → 业务解释 → 记忆更新 本文中的路径实验是该思想的测试床。具体的类ALNS引擎、城市和发现的规则并非核心贡献。它们是RACL过程能够产生有意义控制行为的证据。 核心研究问题是: > 推理智能体能否从操作记忆和有界实验中学习有用的元启发式控制行为? 结果支持肯定答案。RACL在测试床中产生了有用的规则,但规则本身并非主要结果。主要结果是获得、测试、保护、整合和解释规则的方法。 ## 2 相关工作 本工作处于超启发式、自适应算子选择、案例推理、基于学习的优化以及LLM辅助启发式生成的交叉领域。 超启发式是最接近的方法家族。早期工作将超启发式定义为选择或生成启发式的高层方法,而非直接在解空间中求解[4 (https://arxiv.org/html/2606.20142#bib.bib4)]。后来的综述巩固了这一观点,并将超启发式定位为提升启发式搜索通用性的一种方式[5 (https://arxiv.org/html/2606.20142#bib.bib5)]。选择型超启发式尤其相关,因为它们在搜索过程中从现有低级启发式中进行选择[6 (https://arxiv.org/html/2606.20142#bib.bib6)]。RACL共享这种高层控制观点,但不同之处在于控制器被明确框架化为一个利用操作记忆来制定、测试、整合和解释假设的推理智能体。 自适应大邻域搜索(ALNS)提供了本文使用的实验基础,但RACL并非ALNS特有。Ropke和Pisinger将ALNS应用于带有时间窗的取送货问题[14 (https://arxiv.org/html/2606.20142#bib.bib14)],后续工作将大邻域搜索和ALNS原则总结为通用元启发式框架[11 (https://arxiv.org/html/2606.20142#bib.bib11)]。最近的研究探索了更先进的ALNS在线控制,包括用于算子和参数控制的深度强化学习[12 (https://arxiv.org/html/2606.20142#bib.bib12)]以及用于算子选择的图强化学习[7 (https://arxiv.org/html/2606.20142#bib.bib7)]。这些方法很接近,因为它们观察搜索过程并调整算法行为。RACL的不同之处在于将控制视为对操作记忆的推理过程:智能体不仅仅是选择算子;它还解释、测试、保护和整合控制知识。 案例推理为记忆组件提供了信息。经典的CBR检索、重用、修正和保留先前的案例[1 (https://arxiv.org/html/2606.20142#bib.bib1),8 (https://arxiv.org/html/2606.20142#bib.bib8)]。RACL遵循这一直觉,但存储的是搜索控制经验而非完整路径解决方案。每个案例可能包括观察到的搜索状态、所选动作、理由、结果和可行性状态。因此,记忆被视为控制决策的证据,而非可重放路径计划的仓库。 基于学习的优化已大幅增长。综述涵盖了通用组合优化的机器学习方法[3 (https://arxiv.org/html/2606.20142#bib.bib3)]以及VRP特定的学习方法[9 (https://arxiv.org/html/2606.20142#bib.bib9)]。基于强化学习的神经组合优化是学习路径类问题策略的重要早期例子[2 (https://arxiv.org/html/2606.20142#bib.bib2)]。RACL更接近混合或逐步基于学习的优化方法,而非端到端神经路径规划:智能体不直接输出路径,而是控制一个传统优化器,该优化器仍负责路径构建和可行性。 最近的LLM相关工作表明,语言模型可以参与启发式生成、程序搜索和自动算法设计。FunSearch将LLM生成的程序变体与评估器和进化搜索相结合[13 (https://arxiv.org/html/2606.20142#bib.bib13)]。ReEvo将LLM框架化为具有反思进化的语言超启发式[16 (https://arxiv.org/html/2606.20142#bib.bib16)]。LLaMEA使用LLM驱动的进化循环生成元启发式[15 (https://arxiv.org/html/2606.20142#bib.bib15)],而启发式进化则使用LLM进化自然语言启发式思想和可执行代码[10 (https://arxiv.org/html/2606.20142#bib.bib10)]。这些系统使用基于语言的推理来改进优化行为。RACL采取了不同的立场:智能体不生成新的求解器或新的启发式代码;它通过有界、可审计的控制行为来治理现有的元启发式。 本文解决的研究缺口是操作层面的。问题不仅在于模型能否设计启发式,还在于推理智能体能否作为现有优化引擎上的实用控制学习层,利用历史局部证据,保护客户拥有的业务约束,并产生非技术运营用户能理解解释。 ## 3 RACL方法 ### 3.1 概述 RACL将推理智能体视为元启发式优化器的控制学习层。 优化器仍负责生成可行解。智能体通过选择有界算法动作来控制搜索过程。它不能修改配送需求、车队约束、优先截止时间或任何其他业务规则。 RACL循环如下: 观察 → 检索 → 推理 → 假设 → 干预 → 评估 → 防护 → 整合 → 解释 → 更新记忆 ### 3.2 完整架构与当前实现 在完整的RACL架构中,推理智能体是一个在线层。它观察每次执行块,检索操作记忆,在适当时应用已整合的策略,在当前情况未充分覆盖时制定新假设,测试有界干预,评估其效果,应用防护措施并随时间更新记忆。 当前的实验实现不需要生产级LLM服务。在概念验证阶段,Codex被用作循环中的推理智能体,观察执行过程、解释日志并提出实时的有界干预。它审查状态和日志,利用积累的记忆,提出假设,选择有界干预,解释结果并引入防护措施。随后将产生的RACL行为编码为本地策略代理,以便与基线进行可重复评估。 这一区别是方法论上的。本文验证的是智能体达到有用控制规则的过程。策略代理是评估产物,而非科学对象。 ### 3.3 运行时推理与记忆整合 RACL是一个运行时学习循环,而非静态规则。在目标架构中,优化器执行一个块,智能体接收可观察的搜索状态,检索相关记忆,决定是应用已整合的策略还是制定新的有界假设,应用受控干预,评估结果,当出现风险时引入防护措施,并在证据一致时整合策略。 该循环可总结为一系列有界的运行时操作: 1. 1.观察搜索状态并检索操作记忆; 2. 2.对匹配的证据和当前行为进行推理; 3. 3.应用匹配的策略或制定有界假设; 4. 4.在受控块期间进行干预; 5. 5.评估成本、停滞、退化和可行性; 6. 6.如果出现风险则添加防护措施; 7. 7.如果证据重复则整合策略; 8. 8.解释决策并更新记忆以备未来执行。 表 1:运行时 RACL 循环。 ### 3.4 运行时 RACL 决策轨迹 为了使推理层可观察,实验记录了干预事件,包括动作前的状态、所选动作以及干预后的结果。表 2 (https://arxiv.org/html/2606.20142#S3.T2) 展示了来自 Sevilla-9/10 验证事件的代表性轨迹。 表 2:代表性运行时 RACL 决策轨迹。这些轨迹很重要,因为它们展示了 RACL 在搜索过程中的行为,而不仅仅报告最终聚合结果。第二条轨迹的业务可读解释如下:规划过程似乎陷入停滞,因此智能体允许了更强的路径重组;一旦找到更好的区域,它便切换到更聚焦的搜索以稳定改进,同时可行性检查继续保护容量、时间和优先级约束。 ### 3.5 可观察状态、记忆与动作 每个块之后,智能体观察一个紧凑的状态摘要:最优成本、当前成本、近期改进、接受率、改进率、自上次改进以来的迭代次数、路径数、未分配路径和可行性指标。 操作记忆存储先前的状态、动作、原因、结果和可行性结果。记忆不被视为真理。它是智能体可以检索、重新解释和修正的证据。 当前动作空间包括:基线、路径探测、返回基线、路径多样化、以及路径多样化后的强化。这些动作是有界算法干预的实验性示例。它们并非通用规则,也不是贡献本身。 ### 3.6 持续学习 RACL 专为重复运营使用而设计。它预计不会发现一条规则然后停止。随着时间的推移,智能体可能会强化持续有效的规则,缩小仅在特定上下文中有效的规则,淘汰停止工作的规则,在记忆提示有机会时制定新假设,安全测试新干预措施,并在证据支持时整合新策略。 这种持续学习观点是本文的核心。RACL 的价值在于达成和修订规则的方法,而非在一次实验中获得的特定规则。 ## 4 实验设计 ### 4.1 实验目的 实验测试 RACL 方法能否产生有用的控制行为。 路径引擎、数据集和具体的控制动作是实验载体。它们不是主要贡献。实验旨在回答智能体是否能够利用记忆和推理来发现、测试和整合算法控制规则,从而在保持可行性的同时改进基线元启发式。 ### 4.2 比较策略 比较四种策略。 **固定基线**:执行路径元启发式,无自适应干预。 **操作记忆策略(OMP)**:代表从历史记忆派生的第一个策略。它捕获了保守的记忆支持控制。 **停滞触发策略(STP)**:一个非推理的超启发式基线。它通过对停滞做出反应,应用有界的路径级探测,然后返回基线。它不使用记忆检索、假设生成或学习到的防护措施。 **RACL 策略代理**:代表由推理智能体过程整合的行为。它是从 Codex 在循环推理、有界实验和防护措施整合中提炼出的评估产物。 ### 4.3 指标 主要指标是最终路径成本。在将任何结果视为有效证据之前检查可行性。 分析还报告获胜/平局/失败计数、平均和中位成本差值、运行时间、干预
相似文章
Reason--Imagine--Act:基于世界模型的闭环大语言模型决策在自动驾驶中的应用
提出了Reason-Imagine-Act (RIA),一种将大语言模型推理器与动作条件世界模型相结合的闭环框架,用于自动驾驶中的在线安全验证,在CARLA仿真中实现了80.05%的路线完成率和0.20%的碰撞率。
ICRL:通过强化学习内化自我批判
本文介绍了ICRL框架,该框架联合训练求解器和批判器,通过强化学习内化批判指导,使求解器无需外部批判即可自我改进。它使用分布校准和角色分组优势估计,在智能体和数学推理任务上比GRPO提高了6-7个点。
面向异构大语言模型多智能体系统的迭代式批评与路由控制器
本文介绍了一种用于多智能体大语言模型系统的批评与路由控制器,将协调过程建模为序贯决策问题。该方法利用策略梯度优化控制器以实现迭代优化,在表现优于基线方法的同时,降低了对顶级模型的依赖。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。
何时规划:学会在响应式控制与深思熟虑的规划之间进行选择
本文介绍了一种强化学习方法,用于训练一个元推理策略,该策略基于响应式策略的不确定性,在快速的响应式控制与较慢的深思熟虑规划之间进行选择,从而在导航任务中实现更好的平衡与适应性。