LoopArena:针对循环工程的运行时控制器模型基准测试

Hugging Face Daily Papers 论文

摘要

LoopArena推出一项基准测试,评估模型在编码代理任务中充当循环工程运行时控制器的表现,结果显示严格成功率较低,但成本显著降低。

循环工程正成为围绕编码代理组织开发工作的实践。从业者设计循环来监控进度、分配工作、运行检查,并决定代理下一步应做什么,而不是手动编写每个提示。即使有一个能力强的编码代理,循环也可能信任过时的进度记录、跳过必要的验证、将预算花在错误的方向上,或在任务安全提交前停止。然而,一次端到端运行的最终结果无法判断成功或失败是反映了循环的指导还是编码代理执行任务的能力。我们推出LoopArena,一个用于评估一个模型如何引导一个独立的编码代理完成长时间运行任务的基准测试。被评估的模型是控制器:在每个编码轮次后,它接收运行的结构化摘要,并指导一个独立的固定编码代理(工作者)下一步应做什么或验证什么,或决定是否停止。LoopArena在三个互补的设置中评估这种能力,这些设置在执行范围和成本上有所不同。I型通过执行验证的问题对下一步循环契约选择进行评分,评估时不运行工作者。II型对完整任务的选定部分执行重复控制,而III型从原始状态评估配对的完整任务。在完整任务上,观察到的最佳严格成功率为24.69\%,在长时域循环控制方面仍有很大改进空间。跨控制器,估计推理成本的配对减少平均为64.4\%,II型在主要核心标准下产生相似的排序(Spearman's \(ρ=0.9747\))。我们在 https://github.com/AMAP-ML/LoopArena 发布基准数据和评估代码。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:02

论文页面 - LoopArena:将模型作为循环工程运行时控制器的基准测试

来源:https://huggingface.co/papers/2608.28281

摘要

LoopArena 基准测试评估了控制器模型在长任务中引导独立编程代理的效果,揭示了较低的严格成功率和显著的成本降低。

循环工程(Loop Engineering)(https://huggingface.co/papers?q=Loop%20Engineering) 正成为一种围绕编程代理(coding agents)(https://huggingface.co/papers?q=coding%20agents)组织开发工作的实践。从业者不再手写每个提示,而是设计循环来监控进度、分配工作、执行检查,并决定代理下一步该做什么。即使拥有强大的编程代理,循环也可能信任过时的进度记录、跳过必要的验证、在错误的方向上消耗预算,或在任务安全提交之前就停止。然而,一次端到端运行的最终结果无法判断成功或失败是反映了循环的引导能力,还是编程代理执行任务的能力。我们推出了 LoopArena (https://huggingface.co/papers?q=LoopArena),这是一个用于评估一个模型如何引导独立的编程代理完成长时间运行任务的能力的基准测试。被评估的模型是控制器(Controller)(https://huggingface.co/papers?q=Controller):在每一轮编程之后,它会接收运行情况的结构化摘要,并向独立的、固定的编程代理——工作器(Worker)(https://huggingface.co/papers?q=Worker)——发出下一步要做什么或验证什么的指令,或决定是否停止。LoopArena (https://huggingface.co/papers?q=LoopArena) 在三种不同的设置中评估这种能力,这些设置在执行范围和成本上有所不同。类型一评估下一步循环契约(Loop Contract)(https://huggingface.co/papers?q=Loop%20Contract)的选择,通过无需在评估时运行工作器(Worker)(https://huggingface.co/papers?q=Worker)的、经执行验证的问题进行评分。类型二对完整任务的选定部分执行重复控制,而类型三从原始状态评估配对的完整任务。在完整任务上,观察到的最佳严格成功率(Strict Success Rate)(https://huggingface.co/papers?q=Strict%20Success%20Rate)为 24.69%,在长期循环控制方面仍有很大改进空间。在不同控制器(Controller)之间,配对的估计推理成本(inference cost)(https://huggingface.co/papers?q=inference%20cost)平均降低了 64.4%,类型二在主要核心标准下产生类似的排序(斯皮尔曼 ρ=0.9747)。我们已在 https://github.com/AMAP-ML/LoopArena (https://huggingface.co/papers?q=LoopArena) 发布基准数据和评估代码。

查看 arXiv 页面 (https://arxiv.org/abs/2608.28281) 查看 PDF (https://arxiv.org/pdf/2608.28281) 项目页面 (https://amap-ml.github.io/LoopArena/) GitHub73 (https://github.com/AMAP-ML/LoopArena) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.28281)

在你的代理中获取本文:

hf papers read 2608.28281

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2608.28281 以从此页面链接到它。

引用本文的数据集 0

无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2608.28281 以从此页面链接到它。

引用本文的 Space 0

无 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.28281 以从此页面链接到它。

包含本文的收藏集 0

无收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到它。

相似文章

仅靠基准测试不够:RAMP——生产系统中代理模型的运行时评估

Hugging Face Daily Papers

RAMP是一个基于生产环境的LLM代理评估框架,可揭示静态基准测试无法察觉的显著能力退化,显示任务完成率在串行工作流中从100%骤降至20%。该框架在真实的编译器构建工作负载上评估了15个主流模型,涉及复杂的工具链交互和分阶段恢复机制。