@dair_ai:来自Microsoft的关于提示优化的重磅论文。(收藏它)声称一个读取你日志的编码代理能胜过…

X AI KOLs Timeline 论文

摘要

Microsoft 推出了 Coding-Agent Skill Distillation(CASD),这是一种提示优化方法,其中现成的编码代理分析代理日志以一次性写出优化的提示,性能优于之前的如 GEPA 和 SkillOpt 的技术,且成本更低。

来自Microsoft的关于提示优化的重磅论文。(收藏它)声称一个读取你日志的编码代理在提示优化方面能胜过 GEPA。总体发现是,你应该给编码代理提供完整的代理日志集,并让它编写分析代码,而不是对小批量轨迹运行搜索循环。CASD 使用一个现成的编码代理在整个轨迹语料库上计算统计信息,找到重复出现的失败模式,读取代表性片段,并将发现作为规则写在一个提示中。它无需环境访问和验证数据。在 ALFWorld、tau2-bench 零售和电信以及 Spreadsheet Bench-Verified 上,一次性改进平均使未优化基线提高了 16.6 分。GEPA 提高了 10.9 分,SkillOpt 提高了 5.3 分。每个优化提示成本约为 1.60 美元,比验证门控搜索便宜超过 22 倍。论文:https://academy.dair.ai/papers/coding-agents-are-strong-prompt-optimizers-2609.26261…
查看原文
查看缓存全文

缓存时间: 2026/09/25 14:42

微软关于提示优化的重磅论文。(收藏)核心发现:一个能读取日志的编码智能体,在提示优化任务上超越GEPA方法。研究总体结论是:应将完整智能体日志交给编码智能体,让其编写分析代码,而非通过小批量轨迹进行搜索循环。CASD方法使用现成的编码智能体,对全部轨迹语料库计算统计、识别常见失败模式、分析代表性案例,并将研究结论转化为单一提示中的行为规则。该方法无需访问环境,也不需验证数据。在ALFWorld、tau2-bench零售与电信场景及Spreadsheet Bench-Verified测试中,单次优化平均提升未优化基线16.6分。GEPA提升10.9分,SkillOpt提升5.3分。每个优化提示成本约1.60美元,较验证门控搜索便宜22倍以上。论文链接:https://academy.dair.ai/papers/coding-agents-are-strong-prompt-optimizers-2609.26261…


编码智能体:强大的提示优化器

来源:https://academy.dair.ai/papers/coding-agents-are-strong-prompt-optimizers-2609.26261 智能体 · 论文对话(https://academy.dair.ai/dashboard/paper-chat/coding-agents-are-strong-prompt-optimizers-2609.26261)

首页

编码智能体:强大的提示优化器

编辑点评

微软的Agamdeep Singh、Sumit Gulwani等人表明,现成的编码智能体在接收静态智能体轨迹语料库后,无需环境访问或验证数据,仅需单次处理即可生成优化提示。

本文解析

关键要点01

CASD方法。编码智能体技能蒸馏技术让编码智能体针对整个轨迹语料库编写并运行分析代码,计算语料库级统计,识别系统性失败模式,检查代表性案例,并将发现转化为行为规则。

02

反思范围。作者将性能提升归因于一次性分析完整语料库,而反思型优化器在每一步仅分析小批量轨迹。

03

实验结果。在ALFWorld、tau2-bench零售电信场景及SpreadsheetBench-Verified四个基准测试中,单次CASD处理在三项任务超越GEPA,四项任务全部超越SkillOpt,平均提升未优化基线16.6分,对比GEPA的10.9分和SkillOpt的5.3分。

04

成本效益。单次优化提示成本约1.60美元,较验证门控搜索便宜22倍以上。

05

基线优势。即使竞争方法获得更多验证数据和无限制环境访问时,CASD仍在两个基准测试中保持领先。

摘要基于搜索的提示优化器通过迭代搜索改进提示:提出编辑方案、执行新运行、对生成轨迹评分,并仅保留能提升验证指标的修改。我们证明这种优化循环并非必要。仅需静态智能体轨迹语料库,现成编码智能体就能直接合成优化提示,无需环境访问或验证数据。我们将此方法称为\textit{编码智能体技能蒸馏}(CASD)。核心洞察在于反思范围——编码智能体不是逐步分析小批量轨迹,而是编写并执行分析代码以计算语料库级统计,识别系统性失败模式,检查代表性案例,并将所得洞察提炼为行为规则。在四个智能体基准测试(ALFWorld、τ^2-bench零售电信场景及SpreadsheetBench-Verified)中,在同等数据访问条件下,单次CASD处理在三项任务超越前沿反思型提示优化器GEPA,四项任务全部超越验证门控反思搜索(SkillOpt),平均提升未优化基线16.6个百分点,对比GEPA的10.9分和SkillOpt的5.3分。由于CASD执行单次离线分析而非迭代搜索,生成优化提示成本仅约1.60美元——较验证门控搜索便宜22倍以上。即使竞争方法获得更多验证数据和无限制环境访问,CASD仍在两项任务中保持领先。这些结果表明,语料库级统计反思可作为迭代搜索之外的可行提示优化替代方案。

相似文章