AutoSaddler:基于智能体执行轨迹的持久化更新自动套件优化

Hugging Face Daily Papers 论文

摘要

AutoSaddler是一个自动套件优化框架,通过使用失败信号迭代更新套件,提升LLM智能体在长期任务上的表现,在GAIA2和SWE-Bench等基准测试中实现了显著提升。

LLM智能体在长期任务上仍然不可靠,其中微小的局部故障可能在扩展交互中累积并导致整体任务失败。虽然外部套件可以显著提升鲁棒性,但套件设计仍然是一个手动且昂贵的过程,需要在提示、工具配置和控制逻辑的广阔空间中进行搜索。我们提出AutoSaddler,一个自动套件优化框架,将套件改进形式化为一个离线学习问题,并使用小批量的失败信号迭代更新套件。AutoSaddler结合了故障轨迹诊断、将套件视为代码的结构化补丁生成,以及基于验证的更新选择。在GAIA2、SWE-Bench Pro和Terminal-Bench 2.0上的实验表明,AutoSaddler显著提升了智能体性能,相比于对应的基础套件,分别实现了9.0、9.6和10.0个百分点的增益。消融研究进一步表明,有效的套件优化受益于三个要素:深度调试而非浅层反思、针对性修改而非无约束编辑、以及泛化感知选择而非特定轨迹修复。总的来说,这些结果表明,自动套件优化是实现更高性能和更可靠智能体系统的一个有前景的路径。
查看原文
查看缓存全文

缓存时间: 2026/08/26 03:15

论文页面 - AutoSaddler:通过代理执行轨迹实现持久更新的自动优化框架

来源:https://huggingface.co/papers/2608.23041 发布于 8月24日

#1 每日推荐论文 (https://huggingface.co/papers/date/2026-08-26) 作者:

,

,

,

,

,

,

,

,

,

,

摘要

AutoSaddler 通过离线的失败驱动优化,自动改进 LLM 代理的执行框架,从而提升其在长周期任务基准测试中的性能。

LLM 代理 (https://huggingface.co/papers?q=LLM%20agents) 在长周期任务上仍然不可靠,微小的局部失败会在长时间交互中累积,最终导致整体任务失败。尽管外部执行框架可以显著提升鲁棒性,但框架设计仍然是一个手动且昂贵的过程,需要在庞大的提示词、工具配置和控制逻辑空间中进行搜索。我们提出 AutoSaddler,一个自动化的框架优化 (https://huggingface.co/papers?q=harness%20optimization) 框架,它将框架改进表述为一个离线学习问题,并利用小批量数据的失败信号迭代更新框架。AutoSaddler 结合了失败轨迹诊断 (https://huggingface.co/papers?q=failure-trace%20diagnosis)、将框架视为代码的结构化补丁生成 (https://huggingface.co/papers?q=structured%20patch%20generation),以及基于验证的更新选择 (https://huggingface.co/papers?q=validation-based%20update%20selection)。在 GAIA2、SWE-Bench Pro 和 Terminal-Bench 2.0 上的实验表明,AutoSaddler 相对于基础框架显著提升了代理性能,分别实现了 9.0、9.6 和 10.0 个百分点的提升。消融研究进一步表明,有效的框架优化 (https://huggingface.co/papers?q=harness%20optimization) 依赖于三个要素:深层调试 (https://huggingface.co/papers?q=deep%20debugging) 而非浅层反思、针对性修改 (https://huggingface.co/papers?q=targeted%20modifications) 而非无约束编辑,以及泛化感知选择 (https://huggingface.co/papers?q=generalization-aware%20selection) 而非特定轨迹修复。这些结果共同表明,自动化的框架优化 (https://huggingface.co/papers?q=harness%20optimization) 是实现更高性能和更可靠代理系统的一条有前景的途径。

查看 arXiv 页面 (https://arxiv.org/abs/2608.23041)查看 PDF (https://arxiv.org/pdf/2608.23041)项目页面 (https://autosaddler-projectpage.github.io/)GitHub6 (https://github.com/microsoft/AutoSaddler)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23041)

在您的代理中获取此论文:

hf papers read 2608\.23041

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.23041 以从此页面链接。

引用此论文的数据集0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.23041 以从此页面链接。

引用此论文的空间0

暂无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.23041 以从此页面链接。

包含此论文的收藏夹0

暂无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

GitHub 仓库:自动代理框架优化

TLDR AI

AutoSaddler 是微软开发的一款工具,通过诊断执行跟踪并应用结构化更新到提示、工具和中间件,自动优化LLM代理框架,展示了显著的基准改进。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。