@_akhaliq: SWE-Bench ProMax——大规模多语言代码重构的智能体基准测试 论文:https://huggingface.co/papers/…
摘要
介绍了SWE-Bench ProMax,一个包含7种编程语言、170个实例的多语言代码重构基准,用于评估AI编程智能体。前沿模型仅达到41.2%的解决率,证实这是一个具有挑战性且尚未饱和的基准。
SWE-Bench ProMax
大规模多语言代码重构的智能体基准测试
论文:https://t.co/2DO56pDC95 https://t.co/JtZpMSoTNF
查看缓存全文
相似文章
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
@swyx:终于发布了!!!@METR_Evals 发现 SWEBench 超半数的结果是无法合并的劣质代码。FrontierCode 代表…
FrontierCode 是 METR 和 Cognition 推出的新编程基准,用于评估 AI 模型在代码可维护性和质量方面的表现,结果显示许多模型会生成无法合并的代码。该基准包含超过 1000 小时的工作量,并表明即使顶尖模型也难以应对,其中 Opus 4.8 在最难的等级上仅获得 13.8%。
性能优化基准是否可靠地衡量编码代理?
本文审计了针对编码代理的三个性能优化基准(GSO、SWE-Perf、SWE-efficiency),发现运行时不稳定、评分规则和任务覆盖率显著影响可靠性,并且许多任务已经至少有一个公开提交解决了。
ProgramBench(5分钟阅读)
ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。
TensorBench: 在基于编译器的张量框架上对代码代理进行基准测试
TensorBench 是一个基于编译器的张量框架上的基准测试,包含199个功能添加和重构任务,评估了七个代码代理,其通过率范围从22.1%到64.8%。