@_akhaliq: SWE-Bench ProMax——大规模多语言代码重构的智能体基准测试 论文:https://huggingface.co/papers/…

X AI KOLs Following 论文

摘要

介绍了SWE-Bench ProMax,一个包含7种编程语言、170个实例的多语言代码重构基准,用于评估AI编程智能体。前沿模型仅达到41.2%的解决率,证实这是一个具有挑战性且尚未饱和的基准。

SWE-Bench ProMax 大规模多语言代码重构的智能体基准测试 论文:https://t.co/2DO56pDC95 https://t.co/JtZpMSoTNF
查看原文
查看缓存全文

缓存时间: 2026/08/11 05:45

SWE-Bench ProMax

面向大规模多语言代码重构的智能体基准测试

论文:https://t.co/2DO56pDC95 https://t.co/JtZpMSoTNF


论文页面 - SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试

来源:https://huggingface.co/papers/2608.09802

发布于 8 月 10 日

· 提交者 https://huggingface.co/YerbaPage

Y

相似文章

性能优化基准是否可靠地衡量编码代理?

Hugging Face Daily Papers

本文审计了针对编码代理的三个性能优化基准(GSO、SWE-Perf、SWE-efficiency),发现运行时不稳定、评分规则和任务覆盖率显著影响可靠性,并且许多任务已经至少有一个公开提交解决了。

ProgramBench(5分钟阅读)

TLDR AI

ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。