标签
PACE-Bench 引入了一个基于模拟器的基准,用于评估在物理适应任务中,经过环境突变后需要迭代重新设计代码的自进化智能体,并揭示了相比参数推断,机制重新设计是一个主要瓶颈。
CurateEvo 是一个以失败为驱动的动态进化框架,用于智能体后训练的数据策展。它利用失败轨迹迭代重写策展策略,在 ACEBench-Agent 和 BFCL-V4 等基准上提升了效果和效率。
NVIDIA 提出 HORIZON,一个自我进化的智能体框架,将硬件设计视为仓库级代码演化,在多个硬件设计套件上实现了100%的基准测试完成率。
本文提出了三种面向LLM驱动的对抗多智能体博弈代码演化的共演化机制(评估器共演化、分层深度评估和弱点压力),在MCTF 2026海上夺旗任务中取得了最先进的结果。