标签
论文介绍了JAZ,一个极简代理框架,它使用单一的调用原语使LLM代理能够处理长期任务和自我改进,无需外部工具,并在评估中超越了MemGPT和ACE等现有系统。
哈佛大学、MIT等实验室的一篇新论文介绍了FINSKILLOPS,这是一种方法,使金融AI代理能够持续从SEC文件错误中学习,同时使用回归测试来保持正确性并安全更新技能。
AutoBot是一个开源智能代理工具,在像OSWorld 2.0和AssistantBench这样的基准测试中,将AI任务完成率比基线提高了18.5%,具有自我改进、层次化记忆和实时语音控制功能,适用于复杂工作流程。
一个自定义的AI智能体自主构建了一个工具,审计了自己的代码,预测到一个bug,之后遇到了它,并通过调整方法恢复了,展示了高级的自我改进能力。
Kent C. Dodds分享了一个软件包,该软件包自动化处理反馈和改进,与Kodykoala、Discord、GitHub、CodeRabbit AI和Cursor AI等工具集成,实现软件的自我改进。
Gumball被介绍为一个模型无关、主动且自我优化的系统,适用于私有云。
Y Combinator 讨论了框架在 AI 中的重要性,强调了它们在提升模型性能、自我改进代理以及个人 AI 和工作自动化等实际应用中的作用。
一条来自@tobi的推文讨论了如何通过自我改进飞轮训练用于专业用例的小型模型非常有效,并指出Shopify ML团队的微调0.8b模型在特定任务上优于GPT 5.6-sol xhigh。
Prime Agent 是一个开源框架,它使用递归子代理和持久化计算来扩展语言模型在编码和推理任务中的长期能力,显著提高了在ARC-AGI-3等基准测试上的性能。
对Hermes Agent的贡献,这是Nous Research开发的一个自我改进的AI代理,具有记忆、技能创建和面向开发者的多平台支持。
Ornith-1.5,一个开源大语言模型家族,推出版本高达397B MoE,在同类模型中达到最先进的性能,并在基准测试中与Claude Opus相媲美。
Hermes Agent 是由 Nous Research 开发的自改进 AI 代理框架,支持多环境部署和模型切换,旨在提高开发效率和用户体验。
Aeon 是一个自主代理框架,可以向仓库交付功能、发现真实漏洞,并部署实时应用,无需审批循环,可在 GitHub Actions 上无人值守运行。它支持跨六种执行环境的 60 多项技能,并且可以为自己编写新技能。
Linus Ekenstam 强调 Prime Intellect 发布了 Prime Agent,这是一个用于编码和长期自主任务的自改进框架,据报道在 ARC-AGI-3 上得分 95.5%,高于人类基线。
Prime Intellect 推出了 Prime Agent,一个用于编程和长期自主任务的自我改进型 RLM 框架,具备程序化工具调用、将上下文作为变量、多智能体消息传递以及可自我修改的框架状态等特点。
这个新AI代理系统由八个专门代理组成,能够自主从GitHub发现、验证并整合新技能,仅在合并前需要人类最终审批。
推文重点介绍斯坦福大学一门3小时的课程,该课程从头开始构建自我改进的AI智能体,涵盖基础知识、多步推理和从反馈中学习,并提到AI工程师的高薪。
一则推文重点介绍了Anthropic和Google工程师在斯坦福的讲座,内容涵盖自我改进的AI代理、代理循环模式以及生成器-验证器差距。
SIFT引入了一种自我改进的文档分类器,它使用成本低廉的SPLADE-LightGBM管道和LLM评判器持续自我教学,同时通过冻结门安全机制防止无声退化,从而无需人工标注开销即可实现自主再训练。
一位开发者分享了他们每月110美元的自动化流水线,该流水线使用Claude AI对GitHub issue进行分类、分解、实现和测试,在两周内完成了27次合并,且故障极少。