@dair_ai:来自Microsoft的关于提示优化的重磅论文。(收藏它)声称一个读取你日志的编码代理能胜过…
摘要
Microsoft 推出了 Coding-Agent Skill Distillation(CASD),这是一种提示优化方法,其中现成的编码代理分析代理日志以一次性写出优化的提示,性能优于之前的如 GEPA 和 SkillOpt 的技术,且成本更低。
查看缓存全文
缓存时间: 2026/09/25 14:42
微软关于提示优化的重磅论文。(收藏)核心发现:一个能读取日志的编码智能体,在提示优化任务上超越GEPA方法。研究总体结论是:应将完整智能体日志交给编码智能体,让其编写分析代码,而非通过小批量轨迹进行搜索循环。CASD方法使用现成的编码智能体,对全部轨迹语料库计算统计、识别常见失败模式、分析代表性案例,并将研究结论转化为单一提示中的行为规则。该方法无需访问环境,也不需验证数据。在ALFWorld、tau2-bench零售与电信场景及Spreadsheet Bench-Verified测试中,单次优化平均提升未优化基线16.6分。GEPA提升10.9分,SkillOpt提升5.3分。每个优化提示成本约1.60美元,较验证门控搜索便宜22倍以上。论文链接:https://academy.dair.ai/papers/coding-agents-are-strong-prompt-optimizers-2609.26261…
编码智能体:强大的提示优化器
来源:https://academy.dair.ai/papers/coding-agents-are-strong-prompt-optimizers-2609.26261 智能体 · 论文对话(https://academy.dair.ai/dashboard/paper-chat/coding-agents-are-strong-prompt-optimizers-2609.26261)
首页
编码智能体:强大的提示优化器
编辑点评
微软的Agamdeep Singh、Sumit Gulwani等人表明,现成的编码智能体在接收静态智能体轨迹语料库后,无需环境访问或验证数据,仅需单次处理即可生成优化提示。
本文解析
关键要点01
CASD方法。编码智能体技能蒸馏技术让编码智能体针对整个轨迹语料库编写并运行分析代码,计算语料库级统计,识别系统性失败模式,检查代表性案例,并将发现转化为行为规则。
02
反思范围。作者将性能提升归因于一次性分析完整语料库,而反思型优化器在每一步仅分析小批量轨迹。
03
实验结果。在ALFWorld、tau2-bench零售电信场景及SpreadsheetBench-Verified四个基准测试中,单次CASD处理在三项任务超越GEPA,四项任务全部超越SkillOpt,平均提升未优化基线16.6分,对比GEPA的10.9分和SkillOpt的5.3分。
04
成本效益。单次优化提示成本约1.60美元,较验证门控搜索便宜22倍以上。
05
基线优势。即使竞争方法获得更多验证数据和无限制环境访问时,CASD仍在两个基准测试中保持领先。
摘要基于搜索的提示优化器通过迭代搜索改进提示:提出编辑方案、执行新运行、对生成轨迹评分,并仅保留能提升验证指标的修改。我们证明这种优化循环并非必要。仅需静态智能体轨迹语料库,现成编码智能体就能直接合成优化提示,无需环境访问或验证数据。我们将此方法称为\textit{编码智能体技能蒸馏}(CASD)。核心洞察在于反思范围——编码智能体不是逐步分析小批量轨迹,而是编写并执行分析代码以计算语料库级统计,识别系统性失败模式,检查代表性案例,并将所得洞察提炼为行为规则。在四个智能体基准测试(ALFWorld、τ^2-bench零售电信场景及SpreadsheetBench-Verified)中,在同等数据访问条件下,单次CASD处理在三项任务超越前沿反思型提示优化器GEPA,四项任务全部超越验证门控反思搜索(SkillOpt),平均提升未优化基线16.6个百分点,对比GEPA的10.9分和SkillOpt的5.3分。由于CASD执行单次离线分析而非迭代搜索,生成优化提示成本仅约1.60美元——较验证门控搜索便宜22倍以上。即使竞争方法获得更多验证数据和无限制环境访问,CASD仍在两项任务中保持领先。这些结果表明,语料库级统计反思可作为迭代搜索之外的可行提示优化替代方案。
相似文章
@rohanpaul_ai: 这篇论文中关于提示编码代理的实用启示。你的编码代理提示可能在浪费计算资源于不需要的工作…
论文揭示了在编码代理中,某些提示指令可能导致冗余工作,而不会提高成功率,并推荐使用有界指令来最小化浪费。
@dair_ai: 关于计算机使用智能体的杰出论文。(收藏)计算机使用智能体通过屏幕操控真实软件,……
PreAct 将成功的智能体运行编译成小型状态机程序,在重复任务上实现 8.5-13 倍更快的重放,无需逐步骤的语言模型调用,并通过运行时屏幕检查确保正确性。
@dair_ai: 一篇展示为代理调优系统提示有效性的 cool 论文。推荐给正在调优代理工具的…
本文介绍了 EvolveTrade,一个框架,它将交易代理的系统提示视为自进化策略,通过根据交易决策和结果的反馈动态调优来提升性能。
@rohanpaul_ai: Meta 论文显示,当编程代理重复使用过去尝试的简短摘要而不是原始日志时,其性能会显著提升……
一篇 Meta 论文显示,编程代理在重复使用过去尝试的简短摘要而非原始日志时性能显著提升,使用 Claude 4.5 Opus 在 SWE-Bench 和 Terminal-Bench 上取得了显著改进。
@dair_ai:MIT和Sakana AI的重磅论文。他们展示了自我改进的编码代理是有效的。最棒的是他们的方法…
该论文提出Self-Improvement via Fast Tree-search (SIFT)框架,利用LLM作为裁判高效评估编码代理中的自我修改,以更少的CPU时间和API成本实现更好的基准性能。