有没有其他人尝试过不进行微调来训练智能体网络?
摘要
作者分享了一个确定性学习框架,它通过将成功的策略提升为持久化的剧本,让多智能体系统在不进行微调或提示词编辑的情况下跨回合改进。在 Mini Amusement Park 基准测试上,奖励从 12,121 提升到 483,019,达到了排行榜第一名。
我很好奇是否还有其他人在思考或尝试过这种方法。但似乎智能体系统最大的限制之一是它们不会在多次运行之间真正地学习。你完成一个回合,扔掉所有发生过的事情,然后重新开始。我们最终构建的是一个围绕多智能体系统的确定性学习框架。在每次回合之后,它会回顾发生了什么,将成功的策略提升为持久化的剧本,丢弃不成功的策略,然后基于更新后的知识开始下一个回合。这种方法的关键在于底层的大语言模型从不改变。运行之间没有微调,也没有提示词编辑。我们在 Mini Amusement Park 基准测试上进行了测试,发现经过七个自主回合后,性能从 12,121 奖励提升到 483,019,这足以让我们登上排行榜第一名,真是不可思议。我主要感兴趣的是是否有其他人在探索类似的想法。如果你在构建智能体系统,你是如何处理跨运行的长周期学习的?
相似文章
持续增强框架:面向自我改进基础智能体的在线适应
本文介绍了“持续增强框架”(Continual Harness),该框架使具身人工智能智能体能够在无需重置环境的情况下实现在线自我改进。研究展示了在《宝可梦》游戏中的显著进展,通过自动化提示词和技能优化,智能体达到了人类水平的表现。
Claude Code 在一夜之间将我的 Agent 框架性能提升了 40%
作者介绍了“Autoharness”,这是一个利用 Claude Code 通过迭代提示词和超参数来自主优化 Agent 框架的工具。在 tau2-airline 基准测试中,该工具使性能提升了 40%。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
Bayesian-Agent:后验引导的LLM代理技能进化框架
Bayesian-Agent 提出了一种框架,将可重复使用的技能和SOP视为假设,通过贝叶斯推理指导代理行为,并利用后验引导的框架优化提升任务性能。使用deepseek-v4-flash在多个基准上取得了显著改进。
智能体优化器能否实现累积提升?——基于 Terminal-Bench 2.0 的持续学习评估
本文在 Terminal-Bench 2.0 上引入了一个两阶段持续学习评估,用以检验智能体优化方法的增益在递归应用时是否能够累积。结果发现,只有包含回归控制的 RELAI-VCL 方法实现了累积性改进。