@dair_ai: https://x.com/dair_ai/status/2066174390048358760
摘要
一个精选的推文串,涵盖了三篇引人注目的人工智能论文:用于高效长上下文推理的MiniMax Sparse Attention、用于自我改进智能体框架的Self-Harness,以及用于衡量智能体经济价值的Agents' Last Exam基准测试。
查看缓存全文
缓存时间: 2026/06/15 09:01
本周顶级AI论文
欢迎阅读本周顶级AI论文速览(6月7日 - 6月14日)。
1. MiniMax 稀疏注意力
超长上下文已成为智能体、代码库级推理、多模态工作流和持久记忆的核心需求,但密集的Softmax注意力机制仍使得百万令牌部署成本高昂。MiniMax 稀疏注意力(MSA)通过在分组查询注意力之上引入块级稀疏性,并搭配一个轻量级路由分支来解决这一问题,该分支为每个查询组选择实际应关注的键值块。
- 双分支注意力设计: 索引分支对完整的因果上下文进行评分,并为每个GQA组独立选择Top-k键值块,而主分支仅对这些被选中的块执行精确的稀疏注意力。
- 硬件感知实现: 论文将稀疏模式与GPU内核协同设计,使用无指数Top-k选择和KV-外部稀疏注意力,以在块粒度访问下提高张量核心利用率。
- 大规模速度提升: 在一个109B参数的原生多模态模型上,MSA在匹配GQA性能的同时,将1M上下文下每个令牌的注意力计算量减少了28.4倍。配套的内核在H800上实现了14.2倍的预填充加速和7.6倍的解码墙钟加速。
- 为何重要: 长上下文只有在能够廉价服务时才真正有用。MSA的吸引力在于它保持机制简单,将其直接训练到一个生产规模的模型中,开源推理内核,并驱动了已发布的MiniMax-M3模型。
论文 | 推文
2. Self-Harness
大多数智能体脚手架都是一次性手工构建后便冻结不动,即使底层模型在不断变化。本文介绍了Self-Harness,这是一种范式,其中LLM智能体自行改进其运行脚手架(即围绕基础模型的提示、工具、记忆和编排),无需人类工程师或更强的外部智能体。由于每个模型都有其独特的失败方式,系统会挖掘这些模型特定的弱点,并将其转化为具体、可执行的脚手架编辑,而非泛泛的建议。
- 三阶段自改进循环: Self-Harness运行弱点挖掘(将执行轨迹聚类为模型特定的失败模式),然后进行脚手架提案(生成多样化但最小的、针对这些失败的编辑),接着进行提案验证(仅在训练集和验证集上通过回归测试后才接受编辑)。
- 跨基础模型的一致提升: 在Terminal-Bench-2.0上,每个测试模型的留出通过率均有提升。MiniMax M2.5从40.5%提升至61.9%,Qwen3.5-35B-A3B从23.8%提升至38.1%,GLM-5从42.9%提升至57.1%。
- 弱点转化为编辑: 该循环并非添加通用指令,而是将每个观察到的失败模式转化为针对记忆、工具或提示的定向修改,报告的相对提升最高可达138%。
- 为何重要: 随着模型的激增和演进,为每个模型手动调优定制脚手架是不可扩展的。Self-Harness表明脚手架本身可以被调整,从而弥合冻结脚手架与其所包装模型之间的差距。
论文 | 推文
3. 智能体的终极考试
来自伯克利RDI的“智能体的终极考试”(ALE)是一个不断演进的基准测试,旨在衡量智能体是否能从事具有经济价值的工作,而不仅仅是在学术测试中取得高分。该基准由250多位行业专家共同构建,将1000多个可验证的任务映射到美国联邦职业分类体系,组织为涵盖13个行业集群的55个子领域。每个任务都有客观、可检查的结果,因此没有主观的人类评分,并且该任务池旨在随着新工作流的加入而持续增长。
- 基于真实职业: 任务根据O*NET和SOC 2018进行定义,涵盖非体力行业,刻意针对智能体实际部署的专业工作流,而非谜题式问题。
- 三个难度层级: 工作分为近期、全范围和终极考试三个层级,使基准能同时追踪近期效用和困难的多步骤长尾工作。
- 远未饱和: 最难层级的主流脚手架平均完全通过率仅为2.6%,即使是Codex搭配GPT-5.5这样的强大配置,在最简单层级上的得分也低于50%,在最难层级上则低于10%。
- 为何重要: 现有基准上的高分并未转化为有经济意义的部署。ALE围绕可验证、专家策划的工作重新定义评估,提供了一个随着智能体改进而应能抵抗饱和的动态目标。
论文 | 推文
4. AI智能体如何重塑知识工作
这篇经济学论文利用来自Perplexity的大规模生产数据,研究了从对话式助手到自主智能体的转变如何重塑知识工作。它将搜索(对话式助手)与计算机(通用智能体系统)在三个维度上进行比较:自主性、效率以及人们承担任务的范畴。其框架是一个成本结构模型,其中智能体具有较高的固定成本和委托成本,但较低的每步边际成本,因此一旦任务足够复杂,智能体就胜出。
- 自主性的实际表现不同: 计算机每个会话执行约26分钟的自主机器工作,而搜索约为33秒;每查询的不满意度在智能体上低55%,分别为1.3%和2.9%。
- 巨大的效率提升: 在匹配的任务上,计算机将完成时间从269分钟缩短到36分钟,与仅使用搜索的人类工作者相比,时间减少了87%,成本降低了约94%。
- 工作范畴向上转移: 智能体查询的认知复杂度更高,71%为抽象或非常规任务(对照为53%),创造性层级的任务量翻倍,并且它们打包了跨职业边界的相互依赖的子任务。
- 为何重要: 数据支持一个清晰的预测:随着委托固定成本的下降,智能体将可负担的价值前沿推向更高价值、多步骤的知识工作,而这正是研究中增长最快的领域,其采用量达到首周成交量的84倍。
论文 | 推文
5. Agentopia
Agentopia是目前最具雄心的智能体社会试验场之一。这份79页的发布报告将100个LLM智能体投入一个持久世界,让它们在10个模拟年中生活、建立关系并追求目标——这个时间跨度比之前按天计算的工作高出数个数量级。除了观察涌现的社会行为外,作者还将模拟用作训练信号,通过拒绝采样优化模型,使其朝向反映人类福祉的生活奖励。
- 天生面向长周期: 早期的智能体社会以天为粒度运行,而Agentopia每个世界模拟十年的生活,揭示出只有在长时间尺度上才会出现的非脚本化社会策略和人际动态。
- 模拟作为训练信号: 生活奖励指标被用于微调更具拟人化特征的模型,这些改进会迁移到模拟之外的后续角色扮演基准中,而非被困在沙盒内。
- 可测量的收益: 经过训练的智能体在CoSER测试总体性能上提升了15.6%,其中拟人化提升最大(23.7%),角色忠实度提升16.4%;它们获得了24.2%更多同伴的尊重和15.9%更多同伴的喜爱。
- 为何重要: 一次运行10年、100个智能体的模拟消耗了137亿个令牌,涉及56.7万次LLM调用。这一规模表明了智能体研究的发展方向:将活生生的、不断学习的群体既作为研究对象,也作为训练数据的来源。
论文 | 推文
6. 在线策略蒸馏的几何学
在线策略蒸馏(OPD)已成为今年讨论最多的后训练方法之一,但它在很大程度上被视为介于监督微调和RL之间的黑箱。这篇论文揭开了它的面纱,从参数几何层面描述了OPD如何改变模型权重,并论证OPD并非SFT和RLVR之间的中间点,而是其自身独特的一种更新方式。
- 影响更少的权重: 与SFT相比,OPD更新影响的参数要少得多,并且大多避开了权重空间的主导主方向,这有助于解释其样本效率。
- 早期子空间锁定: OPD的累积更新在训练初期迅速坍缩到一个狭窄的低维子空间中,而不是像SFT那样散布在许多方向上。
- 该子空间功能上足够: 将训练限制在早期形成的子空间内能够保持OPD的性能,但会大幅降低SFT的性能,这表明这个小子空间确实承载了有用的信号,而非伪影。
- 为何重要: 了解OPD在权重空间中的工作位置,将一种流行但理解不足的方法转变为具有机理说明的方法。这使得该方法更易于推理、与其他目标结合,并有目的地改进,而非通过试错。
论文
7. 前瞻性稀疏注意力
长上下文解码的瓶颈在于KV缓存,它会随着每个令牌的增长而膨胀,在极端上下文长度下迅速占据主导内存。这项以DeepSeek-V4为品牌的工作引入了前瞻性稀疏注意力(LSA),它通过预测未来解码实际需要的上下文部分,并仅保留这些查询关键块,从而避免存储完整的KV缓存。
- 学习到的轻量级索引器: 一个小型索引器并非保留所有内容,而是主动选择对即将生成内容至关重要的KV块,因此物理缓存保持较小,同时不会丢弃模型所需的信息。
- 免骨干网络训练: 一种解耦的训练策略允许索引器独立训练,无需加载完整的骨干模型,从而降低了将这种机制添加到大型模型的成本。
- 巨大的缓存节省,无质量损失: LSA将物理KV缓存缩减至完整上下文基线的13.5%,同时平均准确率还略微提升了0.6%。在500K令牌上下文中,它抑制了超过90%的KV缓存开销,且不会破坏推理稳定性。
- 为何重要: 超长上下文日益成为玩具演示与可用系统之间的分水岭,而内存是瓶颈。预测你需要哪些上下文,而不是保留全部上下文,是一种在真实硬件预算内实现长上下文的实用途径。
论文
8. 潜在空间记忆
视频世界模型难以在长周期内保持一致性,因为显式的3D记忆通常需要昂贵的像素空间循环。Mirage则直接将场景信息存储在扩散潜在空间中,利用深度引导的反投影和潜在空间扭曲来维持持久的空间记忆。该方法报告称,与显式3D记忆基线相比,端到端生成速度提升了高达10.57倍,内存使用降低了55倍,同时改善了长周期空间一致性。
论文
9. 一致性幻觉
多智能体辩论通常根据智能体最终是否达成一致来评判,但本文表明,输出层面的一致性可能掩盖了推理过程中的深层分歧。作者将智能体的推理轨迹和决策抽象为沿两个轴(推理相似性和结论一致性)的四种状态,并标记出“分歧性一致”——即智能体通过非常不同的路径得出相同答案。在600个内容审核项目上,分歧性一致出现了118次,并与真正分歧状态清晰区分开来(Cohen’s d = 0.80)。基于这些类别进行路由,在标记高分歧案例方面优于仅基于分歧的方法。
论文 | 推文
10. 超越标量奖励
奖励模型通常将判断压缩为一个标量,但本文认为人类偏好更好地表示为分数分布,并提出了Z-Reward,它在评分之前将推理内化到预测的分布中。一个大型视觉语言教师模型执行推理密集型判断,并蒸馏到一个紧凑的学生模型以实现高效部署。27B的教师模型达到了89.6%的人类偏好准确率,9B的学生模型几乎持平达到88.6%。当用作强化学习信号时,它在监督基线上实现了41.3%的净偏好提升,优于GRPO和其他奖励方法。
论文
相似文章
@dair_ai: https://x.com/dair_ai/status/2056018543850754283
一份关于5月11日至17日顶级人工智能论文的综述,涵盖了用于长上下文预训练的Lighthouse Attention、grep与嵌入检索在编码代理中的对比,以及揭示LLMs中几何计算器的机制可解释性工作。
@dair_ai: https://x.com/dair_ai/status/2073814128888549810
本周三篇值得关注的人工智能论文精选:自我改进框架(Red Queen Gödel Machine)、MCP 服务器的设计模式,以及关于编码智能体的强化学习奖励验证研究。
@dair_ai: https://x.com/dair_ai/status/2058537927823556668
本周(5月18-24日)顶级AI论文综述,涵盖关于代理的code-as-harness调查、OpenAI自主解决单位距离猜想,以及一种无需遗忘的持续学习记忆模型。
@dair_ai: https://x.com/dair_ai/status/2063644231030214958
每周精选AI论文综述,涵盖MIT的自我修正发现系统、智能体自我进化解析,以及谷歌使用智能体框架进行形式数学的LEAP系统。
@dair_ai: https://x.com/dair_ai/status/2053495521243799717
DAIR AI 的每周精选汇总了多项重磅研究论文,包括通过内化并行推理提升模型性能的 HeavySkill,以及利用强化学习优化智能体编排的 Sakana AI Conductor。此外,还涵盖了 Meta FAIR 关于自我改进预训练的研究工作。