通过自我调节的模拟规划实现高效代理推理
摘要
介绍了 SR²AM,一种通过自我调节的模拟规划实现高效代理推理的框架,在推理 token 减少 26-95% 的同时,达到了与 20-30 倍参数规模模型相竞争的性能。
查看缓存全文
缓存时间: 2026/05/22 18:21
论文页面 - 通过自我调节的模拟规划实现高效智能体推理
来源:https://huggingface.co/papers/2605.22138 高效推理并不是关于更短的思维链,而是关于更优的模拟分配(即,知道何时想象可能的未来,何时直接行动)。
当前的适应性推理方法(Opus 4.7 和 GPT-5.5 中的努力程度旋钮、Token 预算)控制模型思考的量。而 SR2AM 提出了一个更结构性的问题:模型在每一步应该采用何种思考方式?
我们将智能体 deliberation 分解为三个系统:
- 系统 I(反应式执行):针对熟悉情况,进行快速、基于模式化的推理和行动。
- 系统 II(模拟推理):通过世界模型预测未来状态,在行动前评估后果。这是将规划与更长的思维链区分开来的关键。
- 系统 III(自我调节):一个可学习的配置器,自主决定何时进行模拟、向前看多远,以及何时完全跳过规划。
去年,在配套论文 SiRA(https://arxiv.org/abs/2507.23773)中,我们展示了模拟推理相较于反应式基线有高达 124% 的提升——并且强推理模型(o1, o3-mini)在没有这种结构的情况下,作为规划者表现不佳。
SR2AM(https://arxiv.org/abs/2605.22138)增加了自我调节层。结果是,强化学习使模型能够规划更远的未来(+22.8% 的规划范围),而不是更频繁地规划(+2% 的频率)。在性能方面,我们的 30B 模型以少 26-95% 的推理 Token,与 DeepSeek-V3.2(685B)和 Kimi-K2.5(1T)相竞争。
这是一个基于语言世界模型的原型。敬请期待我们在多模态和物理世界模型方面的下一步进展。
配置器的概念——决定何时以及多深入地参与推理过程——并非规划所独有,而是可扩展到未来的学习和适应。
📄 SR2AM:https://arxiv.org/abs/2605.22138 📄 SiRA:https://arxiv.org/abs/2507.23773 🌐 项目:https://sailing-lab.github.io/sr2am-self-regulated-planning 💻 代码:https://github.com/sailing-lab/sr2am
🤗 SR2AM-v0.1-8B:https://huggingface.co/sailing-lab/SR2AM-v0.1-8B 🤗 SR2AM-v1.0-30B:https://huggingface.co/sailing-lab/SR2AM-v1.0-30B
相似文章
Stratagem:通过轨迹调制博弈自博弈学习可迁移推理
# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。
@mdeng34: 前沿LLM正汇聚于高效、自适应推理。Opus 4.7让模型自行决定推理深度。GPT…
新研究引入了SR²AM,这是一种自调节何时使用模拟推理的配置器,提升了LLM的效率和性能。
当进一步推理无益时停止:推理模型中的注意力状态自适应生成
本文提出ASAG,一种无需训练的方法,基于注意力分布自适应地停止大型推理模型的推理,在使用DeepSeek-R1-Distill和Qwen3模型的基准测试中,将token使用量减少约40%,同时准确率提升3.2%。
ARCANA:面向ARC-AGI-2推理的反射式多智能体程序合成框架
ARCANA是一个反射式多智能体框架,将ARC-AGI-2抽象推理任务分解为迭代感知、假设生成、符号执行和反射精炼,在严格约束下提升推理效率。
用想象力思考:基于世界模拟器的主动式视觉空间推理
本文提出了Astra,一个主动式空间推理框架,将经过强化学习训练的VLM策略与一个世界模拟器结合起来,生成新视角的观察结果,以改进视觉语言模型中的空间推理能力。