标签
作者构建了一个自主AI系统,运行真实产品,生成工作内容、进行质量把关、发起拉取请求,并基于分析结果自我改进。主要挑战在于让系统值得信赖,而非让模型更聪明。
作者构建了一个自主智能体,不仅能完成任务,还能通过观察结果、通过拉取请求进行更改,并使用账本验证每个更改来改进自身的代码和产品。关键洞察在于,一个严格的验证步骤——得出确认、拒绝或不确定的结论——对于系统真正学习至关重要。
一位开发者构建了一台自我进化的AI内容机器,可以扫描互联网、运营多个账号,并自主撰写和优化内容。构建者计划将完整架构以免费指南形式发布,并可能开源。
前谷歌工程师发布了一小时课程,涵盖自建代理、RAG记忆和AI循环;声称比付费代理课程更好。
Anthropic发布了五个免费工作坊,内容涵盖从零开始构建AI智能体到自我改进系统,并附有一份指南,介绍了在使用Claude Fable 5时常见的错误。
MILES是一个通过动态扩展逐步记忆并使用可学习选择头来提升LLM推理能力的框架,实现了更好的准确性-效率权衡。
一个开源 MCP 工作流应用,能够利用自身能力进行自我改进,并附有将其用于你自己项目的说明。
ACE (Agentic Context Engineering) 引入了一个框架,将上下文视为不断演化的剧本,防止上下文崩溃,并提高在智能体和特定领域基准测试上的性能。该工作强调了 harness engineering 作为模型训练数据引擎的潜力。
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
作者开发了一个名为“饕餮.skill”的开源工具,可以自动分析两个AI Skill之间的差异,提取参考Skill的优势模式并用目标Skill的技术栈重新实现,实现Skill的持续进化。文章讨论了Skill生态的问题和设计哲学。
程序性记忆蒸馏(PMD)将来自强化学习 rollout 的跨回合信号转化为可复用的程序性记忆,并在训练过程中将其蒸馏到策略权重中,从而在推理时无需记忆即可实现自我改进语言模型。实验表明,PMD 在 SCIKNOWEVAL 上比 SDPO 提升 3.8-5.5%,在 LIVECODEBENCH 上提升 7.9-13.6%。
ReGuide 提出了一种面向扩散策略的自改进框架,利用测试时引导生成纠正性轨迹,然后在该数据上微调策略,在 Robomimic 任务上实现了 1.3–7.7 倍的成功率提升。
Ornith-1.0 是一系列用于智能体编程的开源自我改进模型,通过联合优化脚手架和解决方案展开的强化学习,在编程基准测试中实现了最先进的性能。
来自剑桥大学、英伟达及其他实验室的一篇新论文介绍了Red Queen Gödel机器,这是一种让AI智能体及其评估者共同进化以防止停滞的方法。该方法通过允许评判者在安全交接点改进来避免固定基准,从而在编程和论文写作任务中取得更好的性能。
Deep Reinforce发布了Ornith-1.0系列开源自我改进大语言模型,专为智能代理编码设计,参数规模从9B到397B,在SWE-Bench Verified和Terminal-Bench 2.1等基准测试中取得了最先进的性能,超越了Claude Opus 4.7及其他领先的开源模型。
Ornith-1.0是来自deepreinforce-ai的新一代开源代理式编码模型系列,采用强化学习训练,同时优化解决方案和脚手架。其35B MoE版本在编码基准测试中达到了最先进水平,并支持高效的单一GPU部署。
deepreinforce-ai 发布了 Ornith-1.0-35B-GGUF,这是一个最先进的开源编程智能体模型,它使用自我改进的强化学习来联合优化框架和解决方案生成,在编程基准测试上达到了SOTA性能。
LangChain的循环工程手册通过四个嵌套循环(代理循环、验证循环、事件驱动循环和爬山循环)替代了提示工程,使AI代理能够随着时间的推移自动自我改进。该文章认为,构建自我优化循环如今已成为关键的竞争优势,而非使用更先进的模型。
作者解释了如何使用AI循环工程构建一个自我改进的量化交易系统,其中AI运行循环以自主提示、验证和行动,与手动提示形成对比。