标签
该论文通过行为分析、表示探查和因果干预,研究了AM、POMO和LEHD等神经组合优化(NCO)路由求解器的内部决策机制,揭示了不同架构在构造解决方案时的差异化模式,例如LEHD依赖当前节点表示进行局部决策、起始节点提供全局导航参考。
介绍进化程序性瓶颈(EPB),一种通过LLM驱动的进化将黑箱模型蒸馏为人类可读的程序组合以解读神经组合优化策略的框架。
本文提出了节点-边策略分解(NEPF)方法,以解决多重图上车辆路径问题(VRP)的可扩展性难题。该方法结合了预编码边聚合与分层强化学习,在加快训练和推理速度的同时,实现了最先进的求解质量。