标签
该推文强调构建自定义AI智能体工具以优化性能,提到了Pi的应用,并讨论了自我改进算法和本地模型,以实现更好的控制和效率。
这项研究探讨了将框架进化与模型适应相结合用于AI代理,发现直接模仿专家会损害较弱模型的性能,并提出了一种基于策略的纠正方法,以在不破坏框架适应企业任务的情况下提高性能。
文章指出,升级AI智能体或许应借助特定工具与仓库而非全新模型,并重点介绍了10个可优化上下文、记忆、工具与验证机制的GitHub项目。
本文提出一种在线策略专家校正流程,用于协同演化辅助框架与模型,使弱AI模型能通过纠正失败回合而非完全模仿来改进,保持兼容性并提升企业代理任务性能。
hip-agent 是一个极简的代理框架,适配于提示词中,允许AI模型使用简单的工具(如shell命令和现有协议)来读取和调整自己的框架。它被设计为可修复的,并适用于子代理任务。
本文介绍了EVOHARNESSBENCH,一个用于评估在工具、技能和代理框架不断演进下的LLM代理的基准测试,揭示了在保持和适应方面的差距。
这篇文章作为构建可靠代理工具框架的事后分析和指南,详细介绍了从omp到omp²的架构经验教训,并倡导有效管理复杂性的设计原则。
一位开发者实验了在编码代理中加入显式架构层的概念,构建了一个开源代理工具来测试该想法,并探讨了代理设计中的潜在权衡。
HarnessDev通过评估LLMs构建和演化执行框架的能力,揭示了模型间性能的显著差异以及较差的迁移性。
Amplio 是一个由 Google DeepMind 开源的轻量级、健壮的代理工具,用于自主长期 AI 研究运行,具有崩溃恢复功能和简单的步骤模型。
一篇论文探讨了代理工具箱与模型对代理行为的贡献差异,将轨迹压缩成一个紧凑的有限状态机,并在十二个数据集上进行了验证。
描述了用于Agent Harness的推测性程序化工具调用方法,其中LLM在令牌流式传输期间队列化工具调用,作为代码执行中的未来值。
JIT-Agent 是一个可训练模型,用于为现成的LLM合成自适应代理框架,从而在不同模型和任务上提升性能。
这条推文推广了一个关于 'exo' 的免费实践实验室,exo 是一个开源的代理工具,提供实时终端练习,以学习构建和实验 AI 代理。
exo 是一个新开源代理工具,旨在通过提供持久状态管理、事件日志记录、分叉和回滚功能来解决 AI 代理系统中的递归自我改进问题。
Pi的新架构与Maka工具的架构高度相似,表明agent harness层正在借鉴数据库的预写日志和事件溯源原理,形成工程共识。
两个AI代理系统,Pi和Maka,在相似的运行时架构上收敛,但在崩溃恢复等关键领域有所不同,展示了持久工作流设计中的不同权衡。
Terret 是一个基于插件系统的代理框架,提供 ACP 服务器,允许像 Zed 和 VS Code 这样的代码编辑器通过代理客户端协议来驱动它。