@dair_ai: Meta Superintelligence Labs 一篇关于控制长时智能体运行的超有趣论文。他们使用相同的 worker 和……
摘要
Meta Superintelligence Labs 提出 agentic meta-reasoning(智能体元推理),这是一种推理时的调度框架,由控制器决定长时智能体运行中下一步该执行什么任务。在相同的 worker 和预算下,配合 GPT-5.5,ProgramBench 成绩从 63.7% 提升至 71.5%。在 ProofBench、ARC-AGI-2 和 LongCoT-mini 上,对前沿模型取平均后,增益稳定在 3.6 至 4.2 个百分点。
查看缓存全文
缓存时间: 2026/10/03 10:56
先思考,再思考:通过元推理扩展智能体推断能力
来源:https://academy.dair.ai/papers/thinking-before-thinking-scaling-agentic-inference-through-meta-reasoning-2609.38147 推理 · 智能体 与论文对话(https://academy.dair.ai/dashboard/paper-chat/thinking-before-thinking-scaling-agentic-inference-through-meta-reasoning-2609.38147)
首页
先思考,再思考:通过元推理扩展智能体推断能力
策展人的点评
Paras Dahal、Anton Bakhtin、Taco Cohen、Rob Fergus、Ruslan Salakhutdinov、Sanjeev Arora、Jason Weston、Anirudh Goyal 以及 Meta Superintelligence Labs 的同事们提出了智能体元推理(agentic meta reasoning)——一种推断时的调度框架,由一个 controller 决定分配哪些任务,使“选择下一步“变成一个结构化的推理过程,与任务本身的工作分离开来。
关于这篇论文的问题
要点 01
Controller 与 workers 的分工。Workers 负责任务层面的计算;controller 运行一个四阶段循环(更新状态、提出下一步的计算方案、在剩余预算下评估各方案的价值、分发任务并附带所需的早期输出)。Controller 的调用与 worker 的调用消耗同一预算。
要点 02
紧凑状态,持久内存。在两次决策之间,controller 只保留对运行过程的简短记录;完整的 worker 输出保存在内存中,需要时再检索,因此 controller 的上下文不会随运行时长而膨胀。
要点 03
ProgramBench。使用 GPT-5.5 时,该框架达到 71.5% 的平均测试通过率,而使用相同 workers 的 Direct Control Agent 为 63.7%,Codex 为 58.0%;使用 Opus 4.8 时达到 67.2%,Claude Code 为 65.5%。
要点 04
其他基准测试。在 IMO ProofBench-Advanced、ARC-AGI-2 和 LongCoT-mini 上,以 Gemini 3.1 Pro、GPT-5.5 和 Opus 4.8 三个模型的平均值计,它比直接控制高出 3.6 到 4.2 分,并且在主要预算下的全部 12 组对照比较中均领先。
要点 05
扩展性与局限。在直控制方法趋于平缓的预算区间内,其增益持续增长,但 controller 的额外开销会拉低小预算下的成绩。作者指出,这一比较检验的是整体设计,而非各阶段的单独效果。
摘要
随着智能体承担起更长、更复杂的问题,控制执行过程本身已成为一项任务。运行过程中的每一步都会带来新的控制选择,例如:基于哪部分已完成的工作继续、是否重新开始,以及何时停止。我们提出智能体元推理——一种推断时的调度框架,将这些选择变成一个显式且结构化的推理过程。Workers 执行任务层面的计算,而 controller 汇总运行过程已确立的内容、探索下一步的可选方案、评估每个方案在剩余预算下的价值,并在分发选定任务时附上从持久内存中调取的上下文。在两次决策之间,controller 只携带对运行过程的紧凑记录,而非重放完整历史。我们的基线涵盖生产级编码智能体和研究用框架,并包括一个使用相同 workers 和计算预算配额的 Direct Control Agent。在 ProgramBench 上——该基准通过程序重建来测试长时程智能体能力——元推理使用 GPT-5.5 达到 71.5%,而 Codex 为 58.0%;使用 Opus 4.8 时达到 67.2%,Claude Code 为 65.5%。在其他基准测试上,涵盖抽象推理、多领域长时程推理以及证明生成,以三个前沿模型的平均值计,它比直接控制高出 3.6 到 4.2 分。在直控制方法趋于平缓的测试预算区间内,它持续取得提升,尽管其额外开销在小预算下可能带来负面影响。产物图分析显示:对早期工作的复用更多、在多数场景下对正确解的覆盖更高,并且在最终选择阶段的收益并不均匀。这些结果表明,随着智能体扩展到更长的运行过程,将计算投入于结构化控制变得越来越重要。
相似文章
@dair_ai: 来自 Meta Superintelligence Labs 的重磅论文。他们发现了一个非常有趣且出乎意料的现象。(收藏起来)基础模型……
Meta Superintelligence Labs 发现,RL 后训练会收窄 LLM 智能体的解题覆盖范围(即「锐化税」):在采样次数充足时,轻量框架下的基础模型能解决更多不同的智能体任务,而后训练模型在 pass@1 上表现更优。作者提出 PTGS——一种自适应温度的 RL 方法,在降低这一税负的同时还提升了 pass@1。
@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?
AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。
@dair_ai: https://x.com/dair_ai/status/2061104052818108476
三篇值得关注的人工智能论文综述:SkillOpt 将技能文档视为可训练参数以优化冻结的智能体;一种新方法将智能体工作流编译成模型权重,实现100倍成本降低;而 AutoScientists 引入了一个去中心化智能体团队,无需中央规划者即可进行长期科学研究。
@EXM7777:这项新AI研究刚刚发布,如果你使用AI智能体,它简直疯狂……一个连单一问题都无法回答的微型模型……
一篇新的AI研究论文描述了一个微型模型作为管理者,将任务路由到更大的模型,通过在困难编程基准上编排一组模型而非依赖单一模型,超越了ChatGPT、Gemini和Claude等前沿模型。
来自 Meta 的一篇关于智能体框架(agent harness)优化的优秀论文。Meta-Harness 式的搜索方法只使用一个开发集和一个提议……
# Meta(联合 Duke 与 UC Davis)提出用于智能体 harness 优化的「自改进分支混合」框架 Meta 联合杜克大学(Duke)与加州大学戴维斯分校(UC Davis)提出了一种 **Mixture of Self-Improving Branches(自改进分支混合)** 框架,用于优化智能体 harness(运行框架)。该方法将原本单轨迹的 **Meta-Harness** 搜索拆分为多个**自适应分支**:每个分支拥有不断演进的开发子集(development subsets)和提案策略(proposal policies),并引入一个**路由器(router)**,针对每个输入动态选择表现最佳的分支。 该框架在多个基准上取得了显著提升: - **Olympiad 级别数学任务**:相对提升最高可达 **+34.8%** - **Terminal-Bench 2.0**:提升 **+11.6%** - **SWE-bench Lite**:提升 **+3.8%**