@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……

X AI KOLs Timeline 论文

摘要

TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。

看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题。 经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,超越了更大的模型如Codex 5.2和GLM 5,同时以不到四分之一的训练次数击败了GRPO和GEPA。 通过对比成功和失败的轨迹,TRACE识别自身的弱点(例如错误定位或正确文档的检索),并创建新的合成环境来修复它们。 结果是一个可迁移且样本高效的合成环境/数据生成+微调流水线,用于代理任务。 由 @TarunSures41845 和 @hangoo_kang 领导的出色工作!
查看原文
查看缓存全文

缓存时间: 2026/07/10 12:11

看看 TRACE,一种新的自我改进方法——它让智能体识别自身失败背后缺失的能力,并训练自己去补足这些短板。

经过 TRACE 训练的 Qwen3.6-27B 在 SWE-bench Verified 上达到 73.2%,性能优于 Codex 5.2 和 GLM 5 等更大的模型,同时训练 rollout 次数不到 GRPO 和 GEPA 的四分之一。

通过对比成功与失败的轨迹,TRACE 找出自身的弱点(例如缺陷定位或正确文档的检索),并创建新的合成环境来修复这些问题。

最终得到一套可迁移且样本高效的合成环境/数据生成+微调流水线,适用于智能体任务。

这项工作由 @TarunSures41845 和 @hangoo_kang 主导,干得漂亮!

Hangoo Kang @ ICML ✈️ (@hangoo_kang): “TRACE: Capability-Targeted Agentic Training” 在 ICML AIWILD 获得 Spotlight 🎉

在 SWE-Bench Verified 和 τ2-Bench 上超越直接强化学习、GEPA 和合成智能体数据。

TRACE-Qwen3.6-27B 在 SWE-Bench 上击败 GPT-5.2-Codex、GLM 5 和 Claude 4.5 Sonnet。

与 @TarunSures41845 共同领导。感谢——

相似文章

@Vtrivedy10: https://x.com/Vtrivedy10/status/2066571435871551655

X AI KOLs Timeline

LangChain Labs与Fireworks AI联合研究表明,通过微调开源Qwen模型,可以创建一个能够检测生产轨迹中“感知错误”的轨迹判断器,且该模型在以最高降低100倍成本的同时达到前沿性能。该模型在两个内部数据集上进行了评估,并显示出跨应用的通用性。

BenchTrace:用于测试LLM智能体反思能力与受控演进的基准

arXiv cs.AI

BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。

Qwen3.7:智能代理前沿(15分钟阅读)

TLDR AI

阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。