@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……
摘要
TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。
查看缓存全文
缓存时间: 2026/07/10 12:11
看看 TRACE,一种新的自我改进方法——它让智能体识别自身失败背后缺失的能力,并训练自己去补足这些短板。
经过 TRACE 训练的 Qwen3.6-27B 在 SWE-bench Verified 上达到 73.2%,性能优于 Codex 5.2 和 GLM 5 等更大的模型,同时训练 rollout 次数不到 GRPO 和 GEPA 的四分之一。
通过对比成功与失败的轨迹,TRACE 找出自身的弱点(例如缺陷定位或正确文档的检索),并创建新的合成环境来修复这些问题。
最终得到一套可迁移且样本高效的合成环境/数据生成+微调流水线,适用于智能体任务。
这项工作由 @TarunSures41845 和 @hangoo_kang 主导,干得漂亮!
Hangoo Kang @ ICML ✈️ (@hangoo_kang): “TRACE: Capability-Targeted Agentic Training” 在 ICML AIWILD 获得 Spotlight 🎉
在 SWE-Bench Verified 和 τ2-Bench 上超越直接强化学习、GEPA 和合成智能体数据。
TRACE-Qwen3.6-27B 在 SWE-Bench 上击败 GPT-5.2-Codex、GLM 5 和 Claude 4.5 Sonnet。
与 @TarunSures41845 共同领导。感谢——
相似文章
@ADarmouni:https://arxiv.org/pdf/2607.13988 微软研究院的一篇优秀的强化学习工作,成功提升了Qwen3小型MoE模型的性能……
本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。
@Vtrivedy10: https://x.com/Vtrivedy10/status/2066571435871551655
LangChain Labs与Fireworks AI联合研究表明,通过微调开源Qwen模型,可以创建一个能够检测生产轨迹中“感知错误”的轨迹判断器,且该模型在以最高降低100倍成本的同时达到前沿性能。该模型在两个内部数据集上进行了评估,并显示出跨应用的通用性。
BenchTrace:用于测试LLM智能体反思能力与受控演进的基准
BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。
Qwen3.7:智能代理前沿(15分钟阅读)
阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。
@IntuitMachine: 以下是针对 Satya Nadell 的 Reverse Information Paradox 的本地 LLM 解决方案。你的 AI 代理失败的原因与此相同…
TRACE 是一种方法,通过对比诊断识别 AI 代理缺失的少数能力,然后在合成微环境上训练微小的 LoRA 适配器,在编码基准测试上实现 15 分以上的提升,同时计算量大幅减少。