LoopArena:针对循环工程的运行时控制器模型基准测试
摘要
LoopArena推出一项基准测试,评估模型在编码代理任务中充当循环工程运行时控制器的表现,结果显示严格成功率较低,但成本显著降低。
查看缓存全文
缓存时间: 2026/09/01 12:02
论文页面 - LoopArena:将模型作为循环工程运行时控制器的基准测试
来源:https://huggingface.co/papers/2608.28281
摘要
LoopArena 基准测试评估了控制器模型在长任务中引导独立编程代理的效果,揭示了较低的严格成功率和显著的成本降低。
循环工程(Loop Engineering)(https://huggingface.co/papers?q=Loop%20Engineering) 正成为一种围绕编程代理(coding agents)(https://huggingface.co/papers?q=coding%20agents)组织开发工作的实践。从业者不再手写每个提示,而是设计循环来监控进度、分配工作、执行检查,并决定代理下一步该做什么。即使拥有强大的编程代理,循环也可能信任过时的进度记录、跳过必要的验证、在错误的方向上消耗预算,或在任务安全提交之前就停止。然而,一次端到端运行的最终结果无法判断成功或失败是反映了循环的引导能力,还是编程代理执行任务的能力。我们推出了 LoopArena (https://huggingface.co/papers?q=LoopArena),这是一个用于评估一个模型如何引导独立的编程代理完成长时间运行任务的能力的基准测试。被评估的模型是控制器(Controller)(https://huggingface.co/papers?q=Controller):在每一轮编程之后,它会接收运行情况的结构化摘要,并向独立的、固定的编程代理——工作器(Worker)(https://huggingface.co/papers?q=Worker)——发出下一步要做什么或验证什么的指令,或决定是否停止。LoopArena (https://huggingface.co/papers?q=LoopArena) 在三种不同的设置中评估这种能力,这些设置在执行范围和成本上有所不同。类型一评估下一步循环契约(Loop Contract)(https://huggingface.co/papers?q=Loop%20Contract)的选择,通过无需在评估时运行工作器(Worker)(https://huggingface.co/papers?q=Worker)的、经执行验证的问题进行评分。类型二对完整任务的选定部分执行重复控制,而类型三从原始状态评估配对的完整任务。在完整任务上,观察到的最佳严格成功率(Strict Success Rate)(https://huggingface.co/papers?q=Strict%20Success%20Rate)为 24.69%,在长期循环控制方面仍有很大改进空间。在不同控制器(Controller)之间,配对的估计推理成本(inference cost)(https://huggingface.co/papers?q=inference%20cost)平均降低了 64.4%,类型二在主要核心标准下产生类似的排序(斯皮尔曼 ρ=0.9747)。我们已在 https://github.com/AMAP-ML/LoopArena (https://huggingface.co/papers?q=LoopArena) 发布基准数据和评估代码。
查看 arXiv 页面 (https://arxiv.org/abs/2608.28281) 查看 PDF (https://arxiv.org/pdf/2608.28281) 项目页面 (https://amap-ml.github.io/LoopArena/) GitHub73 (https://github.com/AMAP-ML/LoopArena) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.28281)
在你的代理中获取本文:
hf papers read 2608.28281
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2608.28281 以从此页面链接到它。
引用本文的数据集 0
无数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2608.28281 以从此页面链接到它。
引用本文的 Space 0
无 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.28281 以从此页面链接到它。
包含本文的收藏集 0
无收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
@rohanpaul_ai: 如果管理工作的模型不知道何时重定向、验证或停止,那么强大的编码模型也是不够的。Loop…
LoopArena 将模型作为编码任务的运行时控制器进行基准测试,揭示即使 GPT-5.5 也仅达到 24.69% 的成功率,强调了代理系统中需要更好的控制机制。
你的智能体可能不需要更好的模型,它需要一个更好的循环。
使用Claude Opus 4.8比较智能体运行时的实验表明,运行时效率对性能和成本的影响大于模型本身,强调了AI智能体中更好循环的必要性。TrueForge被突出为一个有用的开源工具,用于检查和优化运行时。
ClawArena-Team: 在语言模型代理中基准测试子代理编排和动态工作流
介绍了ClawArena-Team,这是一个基准测试,用于衡量单个语言模型作为领导者,通过动态工作流创建、委托和编排子代理的管理能力。实验表明,权限授予是一个瓶颈,成本与管理质量脱钩,大多数模型在性能上聚集,而编排行为则差异很大。
仅靠基准测试不够:RAMP——生产系统中代理模型的运行时评估
RAMP是一个基于生产环境的LLM代理评估框架,可揭示静态基准测试无法察觉的显著能力退化,显示任务完成率在串行工作流中从100%骤降至20%。该框架在真实的编译器构建工作负载上评估了15个主流模型,涉及复杂的工具链交互和分阶段恢复机制。
@PythonHub: LoopGain —— 一个用于AI代理循环的开源成本控制器。
LoopGain 是一款开源成本控制器,运用控制理论在检测到收敛时自动停止AI代理循环,从而将API开销降低最高92.8%,同时将执行速度提升约15倍,且不影响质量。