通过自我调节的模拟规划实现高效代理推理

Hugging Face Daily Papers 论文

摘要

介绍了 SR²AM,一种通过自我调节的模拟规划实现高效代理推理的框架,在推理 token 减少 26-95% 的同时,达到了与 20-30 倍参数规模模型相竞争的性能。

代理应如何决定何时以及如何规划?一种主流方法是将代理构建为具有自适应计算能力(例如思维链)的反应式策略,通过端到端训练期望规划隐式地涌现出来。由于无法控制规划的存在性、结构或视野,这些系统会大幅增加推理长度,导致 token 使用效率低下且无法保证准确率的提升。我们认为,高效的代理推理需要将决策分解为三个系统:模拟推理(系统 II)通过世界模型将深思熟虑建立在未来状态预测之上;自我调节(系统 III)通过一个学习到的配置器决定何时以及多深入地规划;以及反应式执行(系统 I)处理细粒度动作。模拟推理提供了跨多样任务的统一规划,无需针对每个领域进行工程化,而自我调节则确保仅在需要时才调用规划器。为验证这一点,我们开发了 SR^2AM(自我调节模拟推理代理大语言模型),将其实现为 LLM 思维链中两个不同的阶段,并以 LLM 作为世界模型。我们探索了两种实例化:从提示驱动多模块系统(v0.1)中记录决策,以及从预训练推理 LLM 的轨迹中重构结构化规划(v1.0),通过监督学习后接强化学习(RL)进行训练。在数学、科学、表格分析和网络信息检索等任务上,v0.1-8B 和 v1.0-30B 分别达到了与 120-355B 和 685B-1T 参数规模系统相竞争的 Pass@1 性能,同时 v1.0-30B 比同类代理 LLM 减少了 25.8-95.3% 的推理 token。RL 使平均规划视野增加了 22.8%,而规划频率仅增长 2.0%,表明它学会了更长远地规划而非更频繁地规划。更广泛地,学习到的自我调节实例化了一个原则,我们期望该原则能超越规划,扩展到代理如何管理自身的学习与适应。
查看原文
查看缓存全文

缓存时间: 2026/05/22 18:21

论文页面 - 通过自我调节的模拟规划实现高效智能体推理

来源:https://huggingface.co/papers/2605.22138 高效推理并不是关于更短的思维链,而是关于更优的模拟分配(即,知道何时想象可能的未来,何时直接行动)。

当前的适应性推理方法(Opus 4.7 和 GPT-5.5 中的努力程度旋钮、Token 预算)控制模型思考的量。而 SR2AM 提出了一个更结构性的问题:模型在每一步应该采用何种思考方式

我们将智能体 deliberation 分解为三个系统:

  • 系统 I(反应式执行):针对熟悉情况,进行快速、基于模式化的推理和行动。
  • 系统 II(模拟推理):通过世界模型预测未来状态,在行动前评估后果。这是将规划与更长的思维链区分开来的关键。
  • 系统 III(自我调节):一个可学习的配置器,自主决定何时进行模拟、向前看多远,以及何时完全跳过规划。

去年,在配套论文 SiRA(https://arxiv.org/abs/2507.23773)中,我们展示了模拟推理相较于反应式基线有高达 124% 的提升——并且强推理模型(o1, o3-mini)在没有这种结构的情况下,作为规划者表现不佳。

SR2AM(https://arxiv.org/abs/2605.22138)增加了自我调节层。结果是,强化学习使模型能够规划更远的未来(+22.8% 的规划范围),而不是更频繁地规划(+2% 的频率)。在性能方面,我们的 30B 模型以少 26-95% 的推理 Token,与 DeepSeek-V3.2(685B)和 Kimi-K2.5(1T)相竞争。

这是一个基于语言世界模型的原型。敬请期待我们在多模态和物理世界模型方面的下一步进展。

配置器的概念——决定何时以及多深入地参与推理过程——并非规划所独有,而是可扩展到未来的学习和适应。

📄 SR2AM:https://arxiv.org/abs/2605.22138 📄 SiRA:https://arxiv.org/abs/2507.23773 🌐 项目:https://sailing-lab.github.io/sr2am-self-regulated-planning 💻 代码:https://github.com/sailing-lab/sr2am

🤗 SR2AM-v0.1-8B:https://huggingface.co/sailing-lab/SR2AM-v0.1-8B 🤗 SR2AM-v1.0-30B:https://huggingface.co/sailing-lab/SR2AM-v1.0-30B

相似文章

Stratagem:通过轨迹调制博弈自博弈学习可迁移推理

Hugging Face Daily Papers

# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。