CurateEvo:面向智能体后训练的数据策展进化
摘要
CurateEvo 是一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。它利用失败轨迹迭代重写策展策略,在 ACEBench-Agent 和 BFCL-V4 等基准上提升了效果和效率。
arXiv:2607.06140v1 公告类型:新
摘要:大型语言模型(LLM)智能体需要后训练方法,以从环境反馈中改进长期决策能力。然而,现有的智能体后训练流程通常将数据策展视为固定的预处理步骤,主要关注数据增强,而忽视了过滤、精炼和适应下游失败。我们提出 CurateEvo,一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。CurateEvo 将策展策略表示为可执行代码,并利用来自保留开发集的失败轨迹迭代重写该策略。在每个周期,进化后的策略将固定的原始语料转换为监督微调数据、强化学习数据和推理时记忆库。进化过程首先通过诊断重复出现的失败模式,并相应地增强、过滤或精炼数据来提高效果,然后通过成本感知目标修剪冗余或低效的训练轮次来提高效率。在 ACEBench-Agent、BFCL-V4 和 {\tau}^2-Bench 上的实验(在有标注和野生数据设置下)表明,CurateEvo 始终优于先前的策展方法,平均分数分别提高了 3.2 分和 2.7 分。进一步分析表明,CurateEvo 与不同的后训练方案兼容,并显著降低了策展开销。
查看缓存全文
缓存时间: 2026/07/08 04:42
# CurateEvo: 面向智能体后训练的数据策展演化 来源:https://arxiv.org/abs/2607.06140 查看 PDF(https://arxiv.org/pdf/2607.06140) > 摘要:大型语言模型(LLM)智能体需要一种后训练方法,能够从环境反馈中改进长程决策能力。然而,现有的智能体后训练流程通常将数据策展视为固定的预处理步骤,主要关注数据增强,而忽略了过滤、精炼以及针对下游失败的自适应调整。我们提出 CurateEvo,一种面向智能体后训练数据策展的、由失败驱动的动态演化框架。CurateEvo 将策展策略表示为可执行代码,并利用来自保留开发集的失败轨迹对其进行迭代重写。在每个周期中,演化的策略将固定的原始语料转换为监督微调数据、强化学习数据以及推理时记忆库。演化过程首先通过诊断重复出现的失败模式并相应地增强、过滤或精炼数据来提升有效性,然后通过成本感知目标剪枝冗余或低效的训练回合来提升效率。在 ACEBench-Agent、BFCL-V4 和 \(\tau^2\)-Bench 上的实验(涵盖有标签数据与原始数据两种设置)表明,CurateEvo 始终优于先前的策展方法,平均得分分别提升 3.2 和 2.7 分。进一步分析表明,CurateEvo 与不同的后训练方案兼容,并且大幅降低了策展开销。 ## 提交历史 来自:Dingzirui Wang [查看邮件](https://arxiv.org/show-email/88252332/2607.06140) **\[v1\]** 2026年7月7日星期二 11:07:00 UTC(366 KB)
相似文章
@dair_ai:// 驾驭智能体进化 // 如果你运行迭代式智能体搜索循环,请注意这一点。(收藏它)一……
AEvo 是一个元编辑框架,通过将提议和评估分为两个角色,并利用累积的记忆指导未来搜索,改进了迭代式智能体搜索。它在开放式优化任务上相比基线实现了26%的相对提升,并取得了最先进的结果。
通用智能体能否自动化数据整理流程?
研究人员推出 Curation-Bench,一个用于评估通用编程智能体能否在 AI 开发中自动完成迭代数据整理循环的基准测试。结果表明,智能体可在十次迭代内达到强基线水平,但可靠的数据研究需要有脚手架支撑的方法适配,而非仅依赖开放式提示。
通用智能体能否自动完成数据筛选?
本文探讨了通用编码智能体(Claude Code、Codex等)能否自动完成数据筛选循环,在10次迭代内达到已发表基准水平,但揭示了探索新方法方面的差距。一种强制智能体适配先前研究的脚手架策略,能以十分之一的数据量产出优于基准的策略。
MetaEvo: 一种用于经验驱动型智能体持续进化的元优化框架
MetaEvo 提出了一种两阶段框架,用于基于LLM的智能体的持续进化,利用基于偏好的优化来增强原则抽象和用于经验重用的模块化架构,在推理基准测试上优于强基线。
EvoEmbedding:面向长上下文检索与智能体记忆的可演化表示
EvoEmbedding是一种动态嵌入模型,它维护一个持续更新的潜在记忆,为长上下文检索生成自适应表示,性能优于更大的专业模型,并改进智能体工作流。