标签
本文提出环境演化方法,以离线方式逐步增加终端代理的任务难度,从而增强持续学习信号,并提升在Terminal-Bench 2.1等基准测试上的性能。
Introduces OpenART, a large-scale arena for red-teaming AI agents via open-ended environment evolution, with over 10K stateful scenarios across 50 domains, plus EMHA, a black-box hypergraph attack achieving 85% ASR across 75 agent-model configurations.