AutoSaddler:基于智能体执行轨迹的持久化更新自动套件优化
摘要
AutoSaddler是一个自动套件优化框架,通过使用失败信号迭代更新套件,提升LLM智能体在长期任务上的表现,在GAIA2和SWE-Bench等基准测试中实现了显著提升。
查看缓存全文
缓存时间: 2026/08/26 03:15
论文页面 - AutoSaddler:通过代理执行轨迹实现持久更新的自动优化框架
来源:https://huggingface.co/papers/2608.23041 发布于 8月24日
#1 每日推荐论文 (https://huggingface.co/papers/date/2026-08-26) 作者:
,
,
,
,
,
,
,
,
,
,
摘要
AutoSaddler 通过离线的失败驱动优化,自动改进 LLM 代理的执行框架,从而提升其在长周期任务基准测试中的性能。
LLM 代理 (https://huggingface.co/papers?q=LLM%20agents) 在长周期任务上仍然不可靠,微小的局部失败会在长时间交互中累积,最终导致整体任务失败。尽管外部执行框架可以显著提升鲁棒性,但框架设计仍然是一个手动且昂贵的过程,需要在庞大的提示词、工具配置和控制逻辑空间中进行搜索。我们提出 AutoSaddler,一个自动化的框架优化 (https://huggingface.co/papers?q=harness%20optimization) 框架,它将框架改进表述为一个离线学习问题,并利用小批量数据的失败信号迭代更新框架。AutoSaddler 结合了失败轨迹诊断 (https://huggingface.co/papers?q=failure-trace%20diagnosis)、将框架视为代码的结构化补丁生成 (https://huggingface.co/papers?q=structured%20patch%20generation),以及基于验证的更新选择 (https://huggingface.co/papers?q=validation-based%20update%20selection)。在 GAIA2、SWE-Bench Pro 和 Terminal-Bench 2.0 上的实验表明,AutoSaddler 相对于基础框架显著提升了代理性能,分别实现了 9.0、9.6 和 10.0 个百分点的提升。消融研究进一步表明,有效的框架优化 (https://huggingface.co/papers?q=harness%20optimization) 依赖于三个要素:深层调试 (https://huggingface.co/papers?q=deep%20debugging) 而非浅层反思、针对性修改 (https://huggingface.co/papers?q=targeted%20modifications) 而非无约束编辑,以及泛化感知选择 (https://huggingface.co/papers?q=generalization-aware%20selection) 而非特定轨迹修复。这些结果共同表明,自动化的框架优化 (https://huggingface.co/papers?q=harness%20optimization) 是实现更高性能和更可靠代理系统的一条有前景的途径。
查看 arXiv 页面 (https://arxiv.org/abs/2608.23041)查看 PDF (https://arxiv.org/pdf/2608.23041)项目页面 (https://autosaddler-projectpage.github.io/)GitHub6 (https://github.com/microsoft/AutoSaddler)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23041)
在您的代理中获取此论文:
hf papers read 2608\.23041
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.23041 以从此页面链接。
引用此论文的数据集0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.23041 以从此页面链接。
引用此论文的空间0
暂无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.23041 以从此页面链接。
包含此论文的收藏夹0
暂无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
GitHub 仓库:自动代理框架优化
AutoSaddler 是微软开发的一款工具,通过诊断执行跟踪并应用结构化更新到提示、工具和中间件,自动优化LLM代理框架,展示了显著的基准改进。
@rohanpaul_ai: 自动修补代理的框架很容易;保留有帮助的补丁才是困难所在。所以如果你让一个模式…
AutoSaddler 是一种从执行跟踪中自动修补代理框架的方法,通过在保留集上测试确保更新泛化,以防止回归。
Adaptive Auto-Harness: 在开放式任务流上实现智能体系统部署的持续自我改进
Adaptive Auto-Harness 是一个框架,用于在开放式任务流上部署的智能体系统的持续自我改进,通过状态性多智能体进化器、harness树和人工引导钩子超越基线。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。