Meta^n:通过涌现深度实现递归自我改进
摘要
本文介绍了Meta^n,这是一种通过应用固定元操作来扩展推理深度的递归自我改进方法,在ARC-AGI-2等基准测试上超越了先前方法。
查看缓存全文
缓存时间: 2026/08/26 03:16
论文页面 - Meta^n:基于涌现深度的递归自我改进
来源:https://huggingface.co/papers/2608.24735
摘要
Meta^n通过递归地将固定的元操作应用于不断增长的输入,构建更深层次的推理层,从而改进自我改进的LLM智能体,且不会破坏系统稳定性。
自我改进的LLM智能体(https://huggingface.co/papers?q=Self-improving%20LLM%20agents)优化的是答案,而非产生这些答案的过程。增加元级别的系统会将该级别固定,而自我编辑的系统必须将其部分编辑机制保持不变以维持稳定,这将其可实现的元深度限制在大约两层。我们提出了Meta^n(https://huggingface.co/papers?q=Meta%5En),它保持元操作(https://huggingface.co/papers?q=meta-operation)固定,并在输入上进行递归。该操作Ω(https://huggingface.co/papers?q=%CE%A9)被重复应用于其自身的产品,同时读取下方的求解器栈(https://huggingface.co/papers?q=solver%20stack)的执行轨迹以及产生它们的代码,然后将下一层写入作为战略预处理(https://huggingface.co/papers?q=strategic%20pre-process)和可调用的辅助函数库。因为Ω(https://huggingface.co/papers?q=%CE%A9)永不改变,所以它不会破坏系统稳定性;并且因为其输入严格增长,每一层都比上一层从更高的立足点进行推理。深度由收敛性决定,而非预先固定,同时进化存档(https://huggingface.co/papers?q=evolutionary%20archive)在层链(https://huggingface.co/papers?q=layer%20chains)上进行搜索。在两个骨干网络上,Meta^n(https://huggingface.co/papers?q=Meta%5En)在所有八个基准测试族上都优于先前的自我改进智能体。最突出的情况是专门设计用于抵抗技能记忆的ARC-AGI-2(https://huggingface.co/papers?q=ARC-AGI-2),在此测试中它是唯一得分高于零的方法。消融研究表明,递归(https://huggingface.co/papers?q=recursion)带来的大部分增益源于每一层传递给下一层的条件设定(https://huggingface.co/papers?q=conditioning),并且尽管没有提示规定,但随着深度增加,不同的层角色会自然涌现。代码可在 https://github.com/minnesotanlp/meta-n 获取
查看arXiv页面 (https://arxiv.org/abs/2608.24735) 查看PDF (https://arxiv.org/pdf/2608.24735) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.24735)
通过您的智能体获取此论文:
hf papers read 2608\.24735
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2608.24735 以从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2608.24735 以从此页面链接。
引用此论文的Space 0
没有Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2608.24735 以从此页面链接。
包含此论文的收藏夹 0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
@omarsar0: 好文。通过涌现深度改进递归自我改进。
这条推文讨论了AI代理中递归自我改进的新方法,突出了涌现深度和元级编辑的约束。
@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。
Frontis-MA1:训练面向机器学习工程中递归自我改进的AI4AI模型
本文介绍了OpenMLE,一个用于研究机器学习工程中递归自我改进的开放全栈系统,并提出了Frontis-MA1,一个经过后训练作为元进化智能体的35B模型。它在MLE-BenchLite上相比其基础模型有显著提升,并能迁移到留出基准上,同时发布了权重和代码。
MetaEvo: 一种用于经验驱动型智能体持续进化的元优化框架
MetaEvo 提出了一种两阶段框架,用于基于LLM的智能体的持续进化,利用基于偏好的优化来增强原则抽象和用于经验重用的模块化架构,在推理基准测试上优于强基线。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。