@dair_ai: https://x.com/dair_ai/status/2063644231030214958

X AI KOLs Following 新闻

摘要

每周精选AI论文综述,涵盖MIT的自我修正发现系统、智能体自我进化解析,以及谷歌使用智能体框架进行形式数学的LEAP系统。

https://t.co/GYkeazYkpZ
查看原文
查看缓存全文

缓存时间: 2026/06/08 03:13

本周顶级AI论文

欢迎阅读本周顶级AI论文(5月31日 - 6月7日)。

1. 自我修订发现系统

来自MIT,这篇论文认为真正的科学发现不是生成答案,而是搜索空间本身的改变,并且一个AI科学家必须无需被告知就能感知到这种转变。它开发了一个范畴论框架,其中证据、人工制品、操作和验证器都被类型化,而发现被定义为对该表征体系的有原则的修订,而不是在固定体系内进行更多搜索。

  • 发现意味着改变体系: 系统被构建为检测表征体系何时应该改变,并自主地修订它。这将AI科学家从一个更快的搜索者重新定位为能够移动其搜索空间边界的东西。

  • 类型化的范畴论基础: 证据、人工制品、操作和验证器都被形式化地类型化。旧的结果通过函子运输被带入新体系,而真正的发现是运输本身无法解释的残余内容。

  • 描述长度门控保持诚实: 提议的修订只有在减少总描述长度时才会被接受,这区分了真正的结构增益与单纯的复杂性增加。在一次运行中,388个提案只产生了25个被接受的修订,一个严格控制的6.4%的比率。

  • 为何重要: 两个具体的实例——蛋白质力学建模和一个带有类型化技能和验证检查点的知识计算图——展示了范畴论既作为形式化语言又作为工程规范。它比仅基于搜索的AI科学家更原则性地提供了自主发现的蓝图。

论文 | 推文

2. 解耦智能体的自我进化

这篇论文提出了每个智能体构建者最终都会遇到的问题:如果一个智能体重写自己的框架,更强的模型是否会产生更好的自我进化智能体?答案是否定的,原因是“自我进化”实际上是两种截然不同的能力,它们的扩展方式非常不同。这项工作将框架更新(进化者模型编写对记忆、工具、提示和技能的编辑)与框架收益(求解者模型实际利用这些编辑来完成任务)分离开来。

  • 更新在不同模型层级之间持平: 框架编辑的质量几乎不依赖于模型强度。由Qwen3.5-9B编写的更新所产生的增益与来自Claude Opus 4.6的增益相当,因此为进化者一方支付前沿模型几乎买不到什么。

  • 收益是非单调的: 利用更好框架的能力遵循一条曲线。弱模型收益很小,中端模型受益最大,最强模型受益少于中端模型,通常是因为它们在没有脚手架的情况下已经解决了任务。

  • 失败模式是具体的: 较弱的求解者要么无法激活相关框架组件,要么不一致地遵循其指令,这就是为什么即使编辑本身很好,它们的增益仍然很小。

  • 为何重要: 实际杠杆是将一个廉价模型放在进化者上,并将你的能力预算花在求解者上。系统设计,而不是原始模型规模,在智能体自我改进中发挥着大部分作用。

论文 | 推文

3. LEAP

来自Google的新研究展示了一个定制智能体框架能够将通用模型在形式数学上推多远。LEAP将一个通用LLM包裹在一个智能体脚手架中,该脚手架将每一步都扎根于Lean编译器,并针对验证器反馈进行迭代。它不是微调一个专门的证明器,而是依赖于非形式推理、指令遵循和自我完善,然后强制每个形式步骤通过编译器检查再继续。

  • 分解,然后验证: 脚手架采用了证明分解和验证器引导优化的自然形式。模型将难定理分解为子目标,起草非形式蓝图,然后Lean编译器检查每个形式步骤,将模糊推理转化为机器可检查的证明。

  • 完整解决Putnam: 在2025年Putnam竞赛中,LEAP解决了所有12个问题,与来自专用前沿数学模型的最新突破相匹配,而无需对基础LLM进行任何数学特定训练。

  • 在IMO级别证明上大幅提升: 在Lean-IMO-Bench上,LEAP将通用LLM的一次性形式解决率从低于10%提升到70%,超过了由专用金牌级IMO系统设定的48%。

  • 为何重要: 这是强有力的证据,表明一个精心构建的框架,而不是一个定制模型,能够在最难推理领域之一上缩小差距。杠杆在于脚手架和围绕通用模型的验证器循环。

论文 | 推文

4. 智能体框架的规模定律

大多数框架调优将每个token和工具调用视为数量才是关键。这篇论文表明情况并非如此,并引入了有效反馈计算(EFC),一个追踪级别的规模坐标,只有当反馈信息丰富、有效、非冗余并且保留用于后续决策时才给予信用,然后根据任务需求进行归一化。

  • 原始预算几乎无法预测成功: 在受控的规模扩展中,原始token和工具调用只能解释有限的结果变化,R平方分别为0.33和0.42。通常的成本代理是弱预测因子,无法预测智能体是否真正成功。

  • 有效反馈几乎解释一切: 经过任务需求归一化的Oracle-EFC达到了0.99的R平方。一旦你测量了真正有用且被保留的反馈,规模行为就变得几乎完全可预测。

  • 在固定预算下质量胜于数量: 在匹配预算的干预中,提高反馈质量将成功率从0.27提升到0.90,而原始成本和工具调用保持不变。胜利来自于更好的反馈,而不是更多的反馈。

  • 为何重要: 框架的规模扩展受控于原始预算转化为持久、任务充分的反馈的效率,而不是你花费了多少计算量。这将框架工程重新定义为反馈质量问题,并给出了一个可以优化的坐标。

论文 | 推文

5. AutoLab

前沿模型能否像优秀研究人员那样真正钻研一个困难的工程问题?AutoLab是一个为超长周期闭环优化设计的基准,旨在回答这个问题。它包含36个由专家精心设计的跨四个领域的任务:系统优化、谜题与挑战、模型开发和CUDA内核优化。每个任务都交给智能体一个正确但故意次优的基线,并要求它在严格的时间预算内进行改进。

  • 坚持战胜强大起点: 最终性能的主导预测因素不是初始解决方案的质量,而是智能体在迭代优化中的坚持。那些不断探索和改进的模型会获胜,无论它们从哪里开始。

  • 大多数模型过早退出: 虽然Claude Opus 4.6展示了强大的长周期优化能力,但大多数前沿模型,包括几个专有模型,要么过早终止,要么在最小进展下耗尽预算。

  • 时间意识是差距所在: 结果指出时间意识和持续迭代,而不是原始的单次能力,是真正强大的长周期智能体所缺失的成分。

  • 为何重要: 第一天的基准测试奖励聪明的首次尝试,但真正的研究和工程奖励耐力。AutoLab衡量的是在数小时任务中真正区分智能体的东西,而基准测试、框架和任务工件都已开源。

论文 | 推文

6. 可重用的上下文工程

上下文膨胀悄无声息地扼杀了长周期运行,而通常的修复方法都被嵌入到智能体自身的提示或权重中,因此它们无法转移。AdaCoM采取了一条不同的路线:它训练一个独立的外部模型来管理冻结智能体的上下文,通过灵活的修改动作,并使用强化学习进行端到端优化。智能体从不改变;只有流入它的上下文在改变。

  • 外部上下文管理器: 一个专用模型编辑智能体的工作上下文,决定保留、压缩或丢弃什么。因为它位于智能体外部,所以可以作为一个即插即用组件重用,而不是为每个骨干重新工程。

  • 使用强化学习训练: 管理器针对任务结果进行端到端优化,学习上下文编辑策略,而不是依赖手工编写的启发式规则或固定截断规则。

  • 在相似智能体之间转移: 迁移实验表明,AdaCoM在能力相似的智能体之间泛化最有效,指向了真正可重用的上下文管理器。它通过保留任务约束和进展同时修剪过时内容,改进了网络搜索和深度研究。

  • 为何重要: 将上下文管理视为一个独立的、可训练的、可迁移的模块,使其与智能体本身解耦。这是一个比将上下文逻辑塞进每个提示更干净的抽象,并且它从外部修复了膨胀问题,而无需触及底层模型。

论文 | 推文

7. 从自身的隐变量中学习

LLM通过预测token来学习,而像JEPA和data2vec这样的世界模型通过预测自己的内部表示来学习。这篇论文提供了第二个方法在样本复杂度上可能更具数据效率的理论依据,使用一个可处理的概率上下文无关文法作为分析设定,其中组合结构可以被精确测量。

  • 数据效率的指数级差距: 预测自身隐变量所需的样本数量在树深度L上是常数,而监督学习和基于token的自监督学习所需的样本数量随L指数级增长。这种优势是结构性的,而非偶然的。

  • 为什么隐变量胜出: 隐变量目标直接暴露了数据的组合、层次结构,因此学习者不必从表面token中重建它。这就是数据效率提升背后的机制。

  • 层次结构可能是隐式的: 分析表明,显式的层次堆叠(如H-JEPA)在很大程度上可能是多余的,因为像data2vec这样的方法已经隐式地学习了层次结构。

  • 为何重要: 随着token预测规模定律逼近数据极限,这为预测抽象而非token的自监督目标提供了一个有原则的论证。它为为什么世界模型风格的训练可以在样本效率上击败暴力next-token预测提供了理论基础。

论文 | 推文

8. 训练后推理数据入门

这份入门是首次将分散的训练后推理数据文献整合到一处,综合了超过150项公开研究和系统报告,这些之前散落在数据集论文、RL撰写材料和实验室报告中。它围绕四个问题组织了这个领域:存在哪些数据对象,什么使它们有用,它们是如何构建的,以及它们如何扩展。关键的重新定义是,一个推理数据项不仅仅是一个提示-响应对:它打包了一个问题或状态、模型行为、评判反馈和归因元数据,其有用性是相对于验证器和语料库其余部分定义的,而不是孤立的。

论文 | 推文

9. 状态外化框架

Harness-1是一个20B搜索智能体,使用强化学习在一个有状态框架内训练,该框架将常规簿记卸载到环境中。论点在于,搜索智能体通常被训练为针对不断增长的记录进行策略,迫使RL同时优化真正的搜索决策和可恢复的状态(如哪些证据有用或哪些主张被检查过)。Harness-1将该状态从策略中移出,进入环境侧的工作记忆,包括候选池、重要性标签的精选集、紧凑证据链接和验证记录。20B智能体在八个检索基准上达到了平均0.730的精选召回率,超越开源基线11.4个百分点,并且匹配或超越了更大的前沿搜索器,在未见领域上具有更强的泛化能力。

论文 | 推文

10. 更多智能体有帮助吗?

这篇论文研究了添加更多智能体是否真的会使单个LLM驱动的多智能体系统变得更好,使用了一个顺序迭代多智能体系统(SIMAS)框架。发现是,性能不会随智能体数量单调扩展,而是遵循收益递减的模式,最终由协调开销驱动退化。有效的系统仍然需要一个有能力的基座模型,最佳智能体数量取决于任务类型,而集体智能实际上是策略性交互设计的产物,而不是智能体多元化的保证结果。对构建者的启示是:设计交互,而不仅仅是堆叠更多智能体。

论文 | 推文

相似文章

@dair_ai: https://x.com/dair_ai/status/2056018543850754283

X AI KOLs Following

一份关于5月11日至17日顶级人工智能论文的综述,涵盖了用于长上下文预训练的Lighthouse Attention、grep与嵌入检索在编码代理中的对比,以及揭示LLMs中几何计算器的机制可解释性工作。

@dair_ai: https://x.com/dair_ai/status/2053495521243799717

X AI KOLs Following

DAIR AI 的每周精选汇总了多项重磅研究论文,包括通过内化并行推理提升模型性能的 HeavySkill,以及利用强化学习优化智能体编排的 Sakana AI Conductor。此外,还涵盖了 Meta FAIR 关于自我改进预训练的研究工作。