@rohanpaul_ai: 自动修补代理的框架很容易;保留有帮助的补丁才是困难所在。所以如果你让一个模式…

X AI KOLs Timeline 论文

摘要

AutoSaddler 是一种从执行跟踪中自动修补代理框架的方法,通过在保留集上测试确保更新泛化,以防止回归。

自动修补代理的框架很容易;保留有帮助的补丁才是困难所在。 所以,如果你让模型从失败跟踪中重写你的提示、工具和钩子,将展开预算花在能捕获附带损伤的保留分割上。 框架优化确实有效,但本文发现,如果不检查更新是否泛化,结果会低于最初的手写框架。 AutoSaddler 诊断小批量中的失败跟踪,将框架视为代码,修补提示、工具和中间件,并仅保留那些同时改善保留开发集的更新。 如果你正在手动调优代理或使用循环中的LLM,保留一组补丁未针对的任务,并评分修复减去回归,而不是仅修复。 – arxiv. org/abs/2608.23041 标题:"AutoSaddler:从代理执行跟踪中实现持久更新的自动框架优化"
查看原文
查看缓存全文

缓存时间: 2026/08/27 11:34

自动修补智能体的执行框架很容易;保留那些有益的修补才是难题。

因此,若允许模型根据故障执行轨迹重写你的提示词、工具和钩子,请将试运行预算用于保留一个独立测试集,以捕获潜在的连带损害。

框架优化确实有效,但本文研究发现:若缺乏对更新泛化能力的检验,其效果甚至可能劣于最初的手工编写框架。

AutoSaddler从微型批次中诊断失败轨迹,将框架视为代码进行处理,修补提示词、工具与中间件,并仅保留那些能同时提升独立开发集性能的更新。

若你正通过人工或LLM在环路中调优智能体,请预留一组修补方案未涉及的任务作为测试集,评估时应综合考量修复效果与性能回退,而非仅关注修复成果。

– arxiv.org/abs/2608.23041

《AutoSaddler:基于智能体执行轨迹实现持久更新的自动化框架优化》

相似文章

GitHub 仓库:自动代理框架优化

TLDR AI

AutoSaddler 是微软开发的一款工具,通过诊断执行跟踪并应用结构化更新到提示、工具和中间件,自动优化LLM代理框架,展示了显著的基准改进。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。