CODS 2025 AssetOpsBench 挑战赛的结果与回顾分析
摘要
本文对 CODS 2025 AssetOpsBench 挑战赛进行了回顾性分析,考察了排行榜饱和、隐藏评估效果以及受奖励的设计模式。
查看缓存全文
缓存时间: 2026/05/14 04:17
论文页面 - CODS 2025 AssetOpsBench 挑战赛结果与回顾分析
来源:https://huggingface.co/papers/2605.08518
摘要
竞赛回顾在解释排行榜测量了什么、隐藏评估如何改变结论以及哪些设计模式获得奖励时非常有用。我们重新审视了 CODS 2025 挑战赛,这是一项基于 Codabench 的隐私感知工业多智能体编排竞赛。我们综合了最终排名表、包含 300 次提交的服务器日志、149 支团队注册信息、最佳提交导出文件、组织者获胜者报告、配套系统论文以及经过验证的规划赛道源代码树。五项结果尤为突出。第一,公开规划排行榜在 72.73% 处饱和,更丰富的提示词并未提升该峰值。第二,隐藏评估改变了故事:公开分数与私有分数在规划赛道中呈中等相关(r=0.69),但在执行赛道中呈负相关(r=-0.13),多个公开执行系统在 45.45% 水平上达到隐藏集的 63.64%。第三,该术语在官方综合评分中数值上几乎无影响——在 0–1 分与 0–100 百分比分数叠加的尺度上,每条赛道最多贡献 0.05 分,而重新缩放将交换前两名团队。第四,该竞赛操作上基于账户,但实质上基于团队:149 支注册团队缩减为拥有非零公开分数的 24 支和完整排名的 11 支,而去重后的注册中有 52.3% 列出了多个用户名。第五,成功的执行方法主要改进了防护栏——响应选择、污染清理、回退和上下文控制——而非新型智能体架构。这些发现明确了评估所奖励的行为,并推动了规模感知综合评分、技能水平诊断和版本化工件发布。
查看 arXiv 页面 (https://arxiv.org/abs/2605.08518)查看 PDF (https://arxiv.org/pdf/2605.08518)项目页面 (https://www.codabench.org/competitions/10206/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.08518)
在您的智能体中获取此论文:
hf papers read 2605.08518
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.08518 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.08518 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.08518 以从此页面链接。
包含此论文的集合1
相似文章
CODS 2025 AssetOpsBench 挑战赛结果及回顾性分析
本文对 CODS 2025 AssetOpsBench 挑战赛进行了回顾性分析,评估了多智能体 AI 系统在工业任务中的表现。文章揭示了公开排行榜与隐藏排行榜之间的差异,并为未来的智能体基准测试提供了诊断建议。
基准饱和之后:CORE-Bench 案例研究
本文反对在基准准确率饱和时直接“废止并替换”的做法,以 CORE-Bench 为例,证明在准确率持平后,从构建效度、效率、可靠性以及人机协作等维度衡量智能体性能,仍能获得有意义的洞见。
聚合排行榜隐藏系统特定获胜者:离线根因分析基准的报告协议审计
本文对离线根因分析基准进行了审计,发现聚合排行榜隐藏了子系统特定的获胜者,通过对11个子系统的778个案例进行成对比较。它发布了一个320行的审计模块,用于重新计算每个子系统的稳定性检查。
CODA-BENCH: 代码智能体能处理数据密集型任务吗?
CODA-BENCH 是一个新的基准测试,用于评估代码智能体在数据密集型任务上的表现,弥合了以代码为中心和以数据为中心的评估之间的差距。它包含来自31个社区的超过1000个任务,具有真实的数据规模和噪声,结果显示即使是最顶尖的智能体也仅能达到61.1%的成功率。
性能优化基准是否可靠地衡量编码代理?
本文审计了针对编码代理的三个性能优化基准(GSO、SWE-Perf、SWE-efficiency),发现运行时不稳定、评分规则和任务覆盖率显著影响可靠性,并且许多任务已经至少有一个公开提交解决了。