推介 SWE-Lancer 基准测试

OpenAI Blog 论文

摘要

OpenAI 推出 SWE-Lancer,这是一个包含超过 1,400 个来自 Upwork 的真实自由职业软件工程任务的基准测试,这些任务价值 100 万美元,旨在评估 AI 模型在实际工程工作中的性能,并将模型能力映射到经济价值。

前沿 LLM 能从真实的自由职业软件工程中赚取 100 万美元吗?
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:57

# 介绍 SWE-Lancer 基准 来源:https://openai.com/index/swe-lancer/ 我们介绍 SWE-Lancer,这是一个包含 1,400 多个来自 Upwork 的自由职业软件工程任务的基准,总价值达到 100 万美元的真实项目报酬。SWE-Lancer 既包括独立工程任务——从 50 美元的 bug 修复到 32,000 美元的功能实现——也包括管理任务,其中模型需要在技术实现提案之间进行选择。独立任务通过由经验丰富的软件工程师三重验证的端到端测试进行评估,而管理决策则与原始聘请的工程经理的选择进行比较。我们评估了模型性能,发现前沿模型仍然无法解决大多数任务。为了促进未来的研究,我们开源了一个统一的 Docker 镜像和一个公开的评估分割版本 SWE-Lancer Diamond。通过将模型性能映射到货币价值,我们希望 SWE-Lancer 能够促进对 AI 模型开发经济影响的进一步研究。 --- **2025 年 7 月 28 日更新:** 数据集和结果已更新至 2025 年 7 月 17 日,可在 https://github.com/openai/preparedness(在新窗口中打开)和我们的系统卡中获取。更新的数据集消除了执行过程中对互联网连接的要求,从而消除了模型性能变异性的主要来源。

相似文章

介绍 SWE-bench Verified

OpenAI Blog

# 介绍 SWE-bench Verified 来源: [https://openai.com/index/introducing-swe-bench-verified/](https://openai.com/index/introducing-swe-bench-verified/) 我们发布了 SWE-bench 的人工验证子集,能更可靠地评估 AI 模型解决实际软件问题的能力。*更新于 2025 年 2 月 24 日* 作为我们[准备框架⁠](https://openai.com/preparedness/)的一部分,OpenAI 开发了一系列指标来追踪、评估和预测模型的自主行动能力

有人对新DeepSWE进行了审计,结果不太好看

Reddit r/singularity

DeepSWE是一个新的基准测试,用于评估AI编程代理在来自活跃开源仓库的真实软件工程任务上的表现,包含113个任务,涵盖TypeScript、Go、Python、JavaScript和Rust,提供隔离环境和基于程序的验证器。