标签
讨论 Google 和 Anthropic 的预测,即递归自我改进(RSI)可能在 2027-2028 年实现,并可能导致无法控制的人工智能奇点。
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。
一篇综述论文,将机器人学习技术按照“冻结权重策略(VLA模型)”与“以代码形式自行编写可执行技能的智能体”这一轴线进行组织,提供了自我改进机制的分类法,并分析了新兴的机器人技能经济。
DarwinX 通过自然选择式的种群搜索进化 LLM 智能体框架,模型权重保持冻结,在不做基准特定修补的情况下,提升了多个基准测试上的验证性能。
Cline CLI更新允许你通过ClinePass使用Kimi K3,ClinePass是一个折扣订阅服务,可提供约5倍更便宜的模型直接API费率访问,并展示了模型自我改进工具的框架,以提高基准测试性能并降低成本。
OpenAI 的博客文章描述了新一代前沿模型 GPT-5.6 Sol 如何通过自我优化来提高自身推理效率,同时保持高智能水平。
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
本文研究了迭代指令微调中使用合成数据时的模型崩溃问题,揭示了崩溃表现为能力极化:强项被强化,弱项则进一步退化。提出了KITE,一个两阶段框架,结合失败引导的数据生成和边界感知的不确定性筛选,确保在多次迭代中稳定提升。
对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。
一项涵盖239篇论文的调研,分析AI智能体如何通过更新模型本身或框架(提示、记忆、工具)来自我提升。
本文分析了AI代理从单循环到基于图形的自我改进架构的行业转变,解释了为什么优化单一指标常常失败,以及改进循环网络如何提供更稳健的解决方案。
本综述为自我改进的自主智能体提供了一个系统框架,将方法分为基础模型改进和脚手架改进,并回顾了应用和评估方法。
本文介绍了Enlightenment,一种针对大规模模型的无需训练的后调整方法,它修改关键模块中的快捷连接而不更新权重,实现了突发的能力提升。通过注意力头混合和标量调制的残差连接,该方法在LLMs和VLMs上展示了有效性。
Google 发布了一款新工具,让 AI 代理通过发现和修复漏洞来自我改进,兼容 Antigravity、Claude Code 和 Codex。
作者构建了一个个性化的AI,它能理解用户的目标、恐惧和自我破坏模式,并且已被他人复刻了650次。
Tom Blomfield 在讲话中探讨了如何利用人工智能构建能够自我改进的公司,分享了相关理念和经验。
推荐并翻译了Lilian Weng关于Harness Engineering for Self-Improvement的博客文章,详细介绍了递归自我改进(RSI)的概念、Harness的模式(工作流自动化、文件系统持久记忆、子Agent)以及编码Agent案例。
LLM-as-a-Verifier 是一种简单、廉价、通用的面向智能体任务的自我改进技术,通过细粒度评分和基于 logprob 的排名,在 SWE-Bench Verified 和 Terminal-Bench V2 等多个基准测试中取得了最先进的性能。