Real-SWE 基准 (新)
摘要
Real-SWE 是一个新的基准,用于评估前沿AI模型在私有、真实世界的企业代码库上的表现,专注于具有业务背景的复杂软件工程任务。
暂无内容
查看缓存全文
缓存时间:
2026/09/12 20:47
# Real-SWE 基准测试 — Specific Labs
来源:https://realswe.withspecific.com/
2026年9月
## 介绍 Real-SWE
在私有、真实世界的企业代码库上评估前沿 AI 模型。
结果 (https://realswe.withspecific.com/#leaderboard)分析 (https://realswe.withspecific.com/#task-by-task)工作量 (https://realswe.withspecific.com/#effort)评估设置 (https://realswe.withspecific.com/#evaluation-setup)## 01 引言
今日我们发布 Real-SWE,一个评估前沿 AI 模型在私有、真实世界企业代码库上表现的基准。每项任务均源自我们从真实企业授权获取的私有生产代码库。这些是工程师们实际处理的问题,包含现有产品带来的所有背景与复杂性。
- **私有代码库。**智能体必须处理专有系统,其代码与解决方案无法在公共互联网上获取。
- **具有业务后果。**正确处理计费、计算税款、迁移客户。这些变更会影响业务运行方式,且通常涉及多个服务。
- **公司特定复杂性。**每家公司都有自己的规则和编码方式。智能体必须理解这些规范,并做出能与现有系统兼容的更改。
**编码智能体能否真正完成现实世界中软件工程师的工作?**
1. 1 Fable 5.1 Claude Code 解决率:38.8%
2. 2 GPT-6 Astra Codex CLI 解决率:33.8%
3. 3 Gemini 3.8 Flash Gemini CLI 解决率:31.2%
4. 4 GLM 5.3 Claude Code 解决率:28.8%
5. =5 Grok 4.6 Grok Build 解决率:23.8%
6. =5 Muse Spark 1.3 Muse Code 解决率:23.8%
7. 7 Kimi K3 Kimi Code 解决率:18.8%
8. 8 GPT-5.6 Sol Codex CLI 解决率:16.2%
解决率等同于 pass@1,对每项任务进行八次独立运行取平均值。显示95%置信区间。
专家生成或合成的任务可能设计良好,但并非真实公司工程师需要完成的逐字实际任务。我们的任务在两个维度上有所不同:底层的编码产物与指令的明确性。这两者都增加了挑战当今前沿模型的复杂性。
我们使用原生工具链来反映企业工程师的实际工作方式,评估模型与工具链的组合而非单独的模型。
### 真实公司任务需要公司特定的上下文
### 正确计费依赖于业务规则与外部服务
修复发票计费,使每个商家征收正确的税款,且对免税客户不征税。
查看完整指令/隐藏完整指令计费服务将于周一重启,该服务发出的每张发票目前都是免税的。平台上的每个商家结算税款的方式不同:有些自行维护税率,有些希望根据我们的税务服务商按买家目的地对每张发票定价,有些则完全不征税;而我们持有免税的客户,无论其商家如何配置都不会被征税。定价目的地意味着需向税务机构提供双方地址、定价行以及该商家所销售的产品类别,根据商家所在的账户使用沙箱或生产环境的税务机构;若税务机构拒绝某地址,必须在不阻止发票的情况下进行报告。税率、税额和总额需出现在发出的发票上,一旦发票结算完成,销售记录将按该发票号码回传至税务机构以便申报核对。欧洲交易方之间的发票需显示双方的增值税登记信息。税务机构与账本可在 TAX_JAR_URL、PROD_TAX_JAR_URL 和 INFLUX_URL 获取。
沙箱环境中的服务
- TaxJar 沙箱
- TaxJar 生产环境
- InfluxDB 账本
- NestJS 服务
- TypeScript
### 智能体跨越代码、基础设施与业务工具工作
Real-SWE 任务环境中的工具与服务。每项任务仅暴露其工作流程所需的服务。
- AWS 模拟器
- Docker
- Kubernetes
- GitHub
- Linear MCP
- PostgreSQL
- MySQL
- MongoDB
- Gel
- Redis
- Go
- Python
- Node.js
- Vitest
- Slack
- Intercom
- Google Drive
- 电子邮件
- ClickUp
### 代码库选择
我们通过严格筛选流程选择代码库,重点关注具有大量用户、强大工程团队及苛刻生产负载的真实公司。以下分析的示例任务来自这些代码库,包括:
- 一个 Luma/Partiful 的竞品,拥有**20万+用户**和**App Store排名前100**
- 一个处理**10万+银行对账单**的消费金融科技平台
- 支持复杂业务工作流的企业级 AI 销售平台
我们优先选择为满足真实用户或业务需求编写的代码,而非仅为基准任务编写的代码。生产工程需要理解现有架构、保持用户依赖的行为,并在实际运营约束内进行更改。
### 简短指令可能涉及大量文件的更改
我们的任务描述需要进行的更改,由智能体在代码库及周围工具中发现实现细节。验证器所需的任何行为必须被明确说明或合理可发现。这导致我们的提示略欠明确,与 DeepSWE 和 Terminal Bench 大致相当,但足够具体以避免遗漏指令。
这项工作涉及跨功能且复杂:单次更改可能跨越应用程序的多个部分。智能体必须理解现有的业务逻辑和公司编码模式,同时保持周围系统正常运行。
提示长度 · 中位数
典型的 Real-SWE 指令长度为1,742个字符。
- FrontierCode:2,056 个字符
- DeepSWE:1,975 个字符
- Terminal-Bench 3:1,584 个字符
- FrontierSWE v2:992 个字符
- Real-SWE:1,742 个字符
参考解决方案编辑的文件数 · 中位数
Real-SWE 中位数为11个文件,而 FrontierCode 和 DeepSWE 为6个。
- FrontierCode:6
- DeepSWE:6
- Real-SWE:11
所有数据均为中位数。FrontierCode 和 DeepSWE 使用 Cognition 的公开比较 (https://cognition.com/blog/frontier-code);FrontierCode 包含任务描述与代码库指南。我们测量了 Terminal-Bench 3 的74个任务 (https://github.com/harbor-framework/terminal-bench/tree/2b0442c3c583b710ca8da14c8e601b99f2f1f244/tasks)、FrontierSWE v2 的34个任务 (https://github.com/Proximal-Labs/frontier-swe-v2/tree/9e3f71cac38ef3d7e14a41b361c7b2b54c59899b/tasks) 以及 Real-SWE 的八个基于代码库的示例任务的指令文件。字符数四舍五入至整数。Terminal-Bench 3 或 FrontierSWE v2 未提供可比的文件编辑数数据。### 模型即使在简短运行中也会失败。
低于10分钟的运行中,71.4%失败,而较长运行的失败率为73.4%。
在充满现有业务逻辑和编码模式的代码库中,处理多个系统并理解需求是困难的。
低于10分钟
低于10分钟:70次失败(71.4%)和28次成功(28.6%),共98次运行。70/98 失败
10分钟或更长
10分钟或更长:398次失败(73.4%)和144次成功(26.6%),共542次运行。398/542 失败
- 失败
- 成功
每项任务都灵感来源于或直接取自私有、真实世界的代码库。我们认为这类任务非常有趣,原因有三:
1. **私有代码库的任务天然超出训练分布。**这类编码任务在互联网上任何地方都不可用,且不太可能曾被任何其他AI模型训练过。真实企业中99%的标记对前沿模型而言是隐藏的。
2. **这些任务是具有经济价值的工作。**此处每项任务都与支出直接相关,并分配给领取薪水的工程师。大多数基准测试测试的是有趣、实验性的能力,这些能力在现实世界中往往不太可能普及。
3. **公司特定的工程模式很重要。**AI代码是否达到了真实世界企业的标准?我们的结果表明,我们远未达到这一现实。许多企业重视代码标准和模式。我们发现当今模型在理解公司编码模式方面较弱,经常遗漏需求或不验证其假设。
## 02 分析
以下是我们基准测试中一小部分任务的分析。如果您对该样本感兴趣,请在此处申请访问权限 (https://realswe.withspecific.com/benchmarks/real-swe/request-access)。
### 10项任务中有6项的解决率低于15%
每项任务每个模型运行8次。### 遗漏需求是最常见的失败原因
失败按观察到的提交行为分组,所有模型使用相同的分类法,遵循 DeepSWE (https://arxiv.org/html/2607.07946v1#A3)。
Fable 5.1
GPT-6 Astra
Gemini 3.8 Flash
GLM 5.3
Grok 4.6
Muse Spark 1.3
Kimi K3
GPT-5.6 Sol
未验证假设
遗漏需求
集成错误
回归
错误文件
#### 没有模型解决每项任务
每个方块代表一次运行:每行是一个任务,每列是一次试验,每个模型每项任务进行八次试验。
Fable 5.1
01
02
03
04
05
06
07
08
09
10
GPT-6 Astra
01
02
03
04
05
06
07
08
09
10
Gemini 3.8 Flash
01
02
03
04
05
06
07
08
09
10
GLM 5.3
01
02
03
04
05
06
07
08
09
10
Grok 4.6
01
02
03
04
05
06
07
08
09
10
Muse Spark 1.3
01
02
03
04
05
06
07
08
09
10
Kimi K3
01
02
03
04
05
06
07
08
09
10
GPT-5.6 Sol
01
02
03
04
05
06
07
08
09
10
成功
未验证假设
遗漏需求
集成错误
回归
错误文件
#### 不同模型以不同方式失败
百分比基于每个模型失败的运行次数,而非所有运行次数。
## 03 工作量与前沿
### 更高的成本并不保证更高的解决率
预估前沿
解决率(%)
10 15 20 25 30 35 40 45
$2 $3 $5 $10
每次运行成本(美元,对数刻度)
Gemini 3.8 Flash:31.2% · $2.50;Gemini CLI
Gemini 3.8 Flash
31.2% · $2.50
GPT-5.6 Sol:16.2% · $2.65;Codex CLI
GPT-5.6 Sol
16.2% · $2.65
Muse Spark 1.3:23.8% · $2.74;Muse Code
Muse Spark 1.3
23.8% · $2.74
Grok 4.6:23.8% · $3.44;Grok Build;使用量不完整,实际成本可能更高
Grok 4.6
23.8% · $3.44
Kimi K3:18.8% · $3.90;Kimi Code;使用量不完整,实际成本可能更高
Kimi K3
18.8% · $3.90
GPT-6 Astra:33.8% · $4.67;Codex CLI
GPT-6 Astra
33.8% · $4.67
GLM 5.3:28.8% · $5.12;Claude Code
GLM 5.3
28.8% · $5.12
Fable 5.1:38.8% · $6.96;Claude Code
Fable 5.1
38.8% · $6.96
### 预估每次运行成本范围在 $2.50 至 $6.96 之间
排名
模型
预估成本(美元)
1
Gemini 3.8 Flash
$2.50
2
GPT-5.6 Sol
$2.65
3
Muse Spark 1.3
$2.74
4
Grok 4.6
$3.44
5
Kimi K3
$3.90
6
GPT-6 Astra
$4.67
7
GLM 5.3
$5.12
8
Fable 5.1
$6.96
按任务平均每次运行
滑动图表查看所有任务。
0
100k
200k
300k
400k
0 1 2 3 4 5 6 7 8 9 10
任务
权限超额行 · Fable 5.1: 34k
多区域扫描 · Fable 5.1: 30k
税务管辖区 · Fable 5.1: 78k
API 令牌计量 · Fable 5.1: 95k
API 密钥与环境 · Fable 5.1: 71k
S3 数据存储测量 · Fable 5.1: 62k
客户身份迁移 · Fable 5.1: 67k
计费计划迁移 · Fable 5.1: 26k
线性化扫描 · Fable 5.1: 86k
分析流归约器 · Fable 5.1: 88k
权限超额行 · GPT-6 Astra: 13k
多区域扫描 · GPT-6 Astra: 13k
税务管辖区 · GPT-6 Astra: 24k
API 令牌计量 · GPT-6 Astra: 31k
API 密钥与环境 · GPT-6 Astra: 32k
S3 数据存储测量 · GPT-6 Astra: 22k
客户身份迁移 · GPT-6 Astra: 25k
计费计划迁移 · GPT-6 Astra: 15k
线性化扫描 · GPT-6 Astra: 33k
分析流归约器 · GPT-6 Astra: 29k
权限超额行 · Gemini 3.8 Flash: 78k
多区域扫描 · Gemini 3.8 Flash: 67k
税务管辖区 · Gemini 3.8 Flash: 95k
API 令牌计量 · Gemini 3.8 Flash: 134k
API 密钥与环境 · Gemini 3.8 Flash: 102k
S3 数据存储测量 · Gemini 3.8 Flash: 106k
客户身份迁移 · Gemini 3.8 Flash: 97k
计费计划迁移 · Gemini 3.8 Flash: 70k
线性化扫描 · Gemini 3.8 Flash: 106k
分析流归约器 · Gemini 3.8 Flash: 88k
权限超额行 · GLM 5.3: 68k
多区域扫描 · GLM 5.3: 53k
税务管辖区 · GLM 5.3: 141k
API 令牌计量 · GLM 5.3: 177k
API 密钥与环境 · GLM 5.3: 125k
S3 数据存储测量 · GLM 5.3: 121k
客户身份迁移 · GLM 5.3: 90k
计费计划迁移 · GLM 5.3: 58k
线性化扫描 · GLM 5.3: 172k
分析流归约器 · GLM 5.3: 169k
权限超额行 · Grok 4.6: 7k
多区域扫描 · Grok 4.6: 3k
税务管辖区 · Grok 4.6: 12k
API 令牌计量 · Grok 4.6: 15k
API 密钥与环境 · Grok 4.6: 16k
S3 数据存储测量 · Grok 4.6: 13k
客户身份迁移 · Grok 4.6: 20k
计费计划迁移 · Grok 4.6: 6k
线性化扫描 · Grok 4.6: 261k
分析流归约器 · Grok 4.6: 315k
权限超额行 · Muse Spark 1.3: 36k
多区域扫描 · Muse Spark 1.3: 43k
税务管辖区 · Muse Spark 1.3: 67k
API 令牌计量 · Muse Spark 1.3: 152k
API 密钥与环境 · Muse Spark 1.3: 104k
S3 数据存储测量 · Muse Spark 1.3: 71k
客户身份迁移 · Muse Spark 1.3: 76k
计费计划迁移 · Muse Spark 1.3: 38k
线性化扫描 · Muse Spark 1.3: 141k
分析流归约器 · Muse Spark 1.3: 137k
权限超额行 · Kimi K3: 30k
多区域扫描 · Kimi K3: 9k
税务管辖区 · Kimi K3: 39k
API 令牌计量 · Kimi K3: 69k
API 密钥与环境 · Kimi K3: 44k
S3 数据存储测量 · Kimi K3: 32k
客户身份迁移 · Kimi K3: 66k
计费计划迁移 · Kimi K3: 19k
线性化扫描 · Kimi K3: 71k
分析流归约器 · Kimi K3: 55k
权限超额行 · GPT-5.6 Sol: 12k
多区域扫描 · GPT-5.6 Sol: 8k
税务管辖区 · GPT-5.6 Sol: 22k
API 令牌计量 · GPT-5.6 Sol: 31k
API 密钥与环境 · GPT-5.6 Sol: 25k
S3 数据存储测量 · GPT-5.6 Sol: 25k
客户身份迁移 · GPT-5.6 Sol: 24k
计费计划迁移 · GPT-5.6 Sol: 13k
线性化扫描 · GPT-5.6 Sol: 37k
分析流归约器 · GPT-5.6 Sol: 30k
Fable 5.1 · 64k 总计
GPT-6 Astra · 24k 总计
Gemini 3.8 Flash · 94k 总计
GLM 5.3 · 117k 总计
Grok 4.6 · 67k 总计
Muse Spark 1.3 · 87k 总计
Kimi K3 · 43k 总计
GPT-5.6 Sol · 23k 总计
查看任务值
任务 - Fable 5.1 34k
- GPT-6 Astra 13k
- Gemini 3.8 Flash 78k
- GLM 5.3 68k
- Grok 4.6 7k
- Muse Spark 1.3 36k
- Kimi K3 30k
- GPT-5.6 Sol 12k
## 04 评估设置
每个智能体都在隔离的沙箱中运行。所有任务均采用 Harbor 格式,验证器在评分时注入。验证器灵感来源于代码库中现有的测试套件或直接使用那些测试。
相似文章
Hacker News Top
Real-SWE 是一个新的基准测试,用于评估AI模型在私有、真实世界企业代码库上的表现,通过提供来自实际生产系统的任务,来评估实用的编码能力。
Reddit r/singularity
DeepSWE是一个新的基准测试,用于评估AI编程代理在来自活跃开源仓库的真实软件工程任务上的表现,包含113个任务,涵盖TypeScript、Go、Python、JavaScript和Rust,提供隔离环境和基于程序的验证器。
Reddit r/LocalLLaMA
Senior SWE-Bench 是一个新的开源基准测试,旨在评估 AI 智能体在现实、未充分指定的软件工程任务上的表现,强调意图对齐和代码质量等技能,而非过于详细的规范。
OpenAI Blog
# 介绍 SWE-bench Verified 来源: [https://openai.com/index/introducing-swe-bench-verified/](https://openai.com/index/introducing-swe-bench-verified/) 我们发布了 SWE-bench 的人工验证子集,能更可靠地评估 AI 模型解决实际软件问题的能力。*更新于 2025 年 2 月 24 日* 作为我们[准备框架](https://openai.com/preparedness/)的一部分,OpenAI 开发了一系列指标来追踪、评估和预测模型的自主行动能力
Reddit r/singularity
基准测试综述,涵盖 SWE-Bench Pro 和 312 个真实工作流任务,可能用于评估人工智能在软件工程挑战中的表现。