标签
介绍了一个 GitHub 57k 星的开源项目 byoungd/up,作为普通人的人生进阶指南,涵盖英语学习、AI 工具实战和个人复盘;同时附带 2.ai 域名组合的高价出售信息。
作者分享激励自己通过App赚到50万并走上自由职业之路的书籍清单,包括《纳瓦尔宝典》《软技能》《低风险创业》等,强调打造边际成本低的产品和被动收入。
Saboo Shubham 宣布开源了一个模板,用于构建能够在后台做梦和自我改进的长周期智能体框架。
讨论 Google 和 Anthropic 的预测,即递归自我改进(RSI)可能在 2027-2028 年实现,并可能导致无法控制的人工智能奇点。
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。
一篇综述论文,将机器人学习技术按照“冻结权重策略(VLA模型)”与“以代码形式自行编写可执行技能的智能体”这一轴线进行组织,提供了自我改进机制的分类法,并分析了新兴的机器人技能经济。
Cline CLI更新允许你通过ClinePass使用Kimi K3,ClinePass是一个折扣订阅服务,可提供约5倍更便宜的模型直接API费率访问,并展示了模型自我改进工具的框架,以提高基准测试性能并降低成本。
OpenAI 的博客文章描述了新一代前沿模型 GPT-5.6 Sol 如何通过自我优化来提高自身推理效率,同时保持高智能水平。
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
本文研究了迭代指令微调中使用合成数据时的模型崩溃问题,揭示了崩溃表现为能力极化:强项被强化,弱项则进一步退化。提出了KITE,一个两阶段框架,结合失败引导的数据生成和边界感知的不确定性筛选,确保在多次迭代中稳定提升。
对1250篇关于AI递归自我改进的论文的分析表明,评估者信号是关键瓶颈。模型只有在强大且可信的信号(如证明检查器)下才能可靠改进,而弱信号则会导致循环崩溃或强化错误。
一项涵盖239篇论文的调研,分析AI智能体如何通过更新模型本身或框架(提示、记忆、工具)来自我提升。
本文分析了AI代理从单循环到基于图形的自我改进架构的行业转变,解释了为什么优化单一指标常常失败,以及改进循环网络如何提供更稳健的解决方案。
本综述为自我改进的自主智能体提供了一个系统框架,将方法分为基础模型改进和脚手架改进,并回顾了应用和评估方法。
本文介绍了Enlightenment,一种针对大规模模型的无需训练的后调整方法,它修改关键模块中的快捷连接而不更新权重,实现了突发的能力提升。通过注意力头混合和标量调制的残差连接,该方法在LLMs和VLMs上展示了有效性。
Google 发布了一款新工具,让 AI 代理通过发现和修复漏洞来自我改进,兼容 Antigravity、Claude Code 和 Codex。
作者构建了一个个性化的AI,它能理解用户的目标、恐惧和自我破坏模式,并且已被他人复刻了650次。
Tom Blomfield 在讲话中探讨了如何利用人工智能构建能够自我改进的公司,分享了相关理念和经验。