大泡菜在SWE Atlas上的表现——代码库问答
摘要
免费隐形AI模型'大泡菜'在Scale AI的SWE Atlas代码库问答基准测试中,使用mini-swe-agent脚手架达到了50.8%的解决率,性能超越同级别其他模型。
查看缓存全文
缓存时间: 2026/08/16 03:41
PhillipChaffee/big-pickle-swe-atlas 来源: https://github.com/PhillipChaffee/big-pickle-swe-atlas
Big Pickle 在 SWE Atlas 上的评测 — 代码库问答
任务解决率: 50.8% (63/124) — big-pickle (https://opencode.ai/docs/zen/),这是 OpenCode Zen 上的免费隐蔽模型,在 Scale AI 的 SWE Atlas (https://github.com/scaleapi/SWE-Atlas) 代码库问答基准上,使用 mini-swe-agent 脚手架进行评测。运行于 2026-08-11,使用官方开源工具、任务数据和裁判模型。
在上下文中的结果
对照官方 SWE Atlas 问答排行榜 (https://labs.scale.com/leaderboard/sweatlas-qna) (更新于 2026-07-28):
| 模型 (脚手架) | 任务解决率 |
|---|---|
| Opus 5 (Claude Code, xHigh) | 63.17 |
| Opus 4.8 (Claude Code, xHigh) | 57.26 |
| big-pickle (Mini-SWE-Agent) — 本次运行 | 50.81 |
| GLM 5.2 (Mini-SWE-Agent) | 48.12 |
| GPT-5.6-Sol (Codex, xHigh) | 46.00 |
| GPT 5.5 (Codex, xHigh) | 45.43 |
在 Mini-SWE-Agent 脚手架类别中——即同类对比——本次运行 得分高于官方排行榜上的所有条目,并且也超过了 Codex 脚手架的 GPT 条目。只有两个运行在其原生 Claude Code 脚手架上的 Claude 模型得分更高。
注意:在将此视为与排行榜等效的数据之前,请阅读以下注意事项。
按语言分类
| 语言 | 解决数 | 解决率 |
|---|---|---|
| TypeScript | 18/31 | 58.1% |
| Python | 16/29 | 55.2% |
| Go | 19/38 | 50.0% |
| C | 10/26 | 38.5% |
按类别分类
| 类别 | 解决数 | 解决率 |
|---|---|---|
| 代码入门 | 17/28 | 60.7% |
| 架构与系统设计 | 23/44 | 52.3% |
| 根本原因分析 | 17/37 | 45.9% |
| 安全性 | 5/11 | 45.5% |
| API 与库用法/集成 | 1/4 | 25.0% |
方法
一切均尽可能遵循 Scale 公布的协议,预算允许的范围内:
- 任务: 全部 124 个来自 scaleapi/SWE-Atlas (https://github.com/scaleapi/SWE-Atlas) (Apache-2.0) 的代码库问答任务,未经修改——包括 Scale 随附的
mswea_qa_config.yaml代理配置(系统/实例模板,step_limit: 250)。 - 工具: Harbor (https://github.com/laude-institute/harbor) v0.18.0,配合 Modal 沙箱,如 SWE-Atlas README 所述。
- 脚手架: mini-swe-agent (https://github.com/SWE-agent/mini-swe-agent) 固定在版本 2.4.6 ——与 Scale 用于排行榜非第一方模型使用的最小化纯 bash 脚手架相同。
- 模型:
big-pickle,通过 OpenCode Zen 的 OpenAI 兼容端点 (https://opencode.ai/zen/v1) 访问,litellm 路由为openai/big-pickle。总消耗:674M 输入 / 4.3M 输出 tokens,费用为 $0(该模型在隐蔽期内免费)。 - 裁判模型:
claude-opus-4-5-20251101—— Scale 指定的精确裁判模型——通过 Anthropic 的 OpenAI 兼容端点 (https://api.anthropic.com/v1) 访问,并将EVAL_MODEL覆盖为纯 Anthropic 模型 ID。 - 评分: 基准自身的基于评分标准的验证器,未经修改。任务仅在通过所有必须项的评分标准后才算解决。
注意事项
在引用该数字之前,请阅读以下内容:
- 每个任务仅运行一次 (
-k 1)。官方协议运行 3 次并报告平均值。在 n=124 的情况下,单次运行的标准误差约为 ±4.5 分——与排行榜自身报告的误差范围 (±5) 相当。 - 沙箱资源缩减。 任务声明需要 16 CPU / 16 GB 内存;本次运行为适应个人预算使用了 4 CPU / 8 GB。较慢的命令执行只会通过命令超时或 OOM 终止来降低代理得分,而不会使其虚高。经验上看来这里似乎没有影响:对全部 124 个代理轨迹的扫描发现了零命令超时和零 exit-137 终止——没有任何命令达到 900 秒上限或内存限制。
- 自报数据。 Scale 未运行或验证此评估。本仓库中包含完整的逐任务验证器日志,可供独立审计,本次运行可从这里的配置加上公开的 SWE-Atlas 仓库复现。
- 模型身份未知。 big-pickle 官方未确认;泄露的提供商错误和 API 响应特征表明其目前由 DeepSeek 基础设施提供服务。底层模型可能会在不通知的情况下更改,因此此结果是 2026-08-11 那个别名背后模型的快照。
- 数据暴露。 OpenCode 表示,在免费期间发送给 big-pickle 的提示可能会被用于改进模型。基准的任务内容(已经公开,由 Scale 添加金丝雀标记)必须发送到该端点。
- 两个已解决任务的评分标准未评分。 在
task-...ba9ad(11 个评分标准中有 5 个)和task-...baa1d(1 个评分标准)上,裁判在全部 8 次重试中均返回了无法解析的输出;基准的验证器按设计将未评分标准排除在通过计算之外。将未评分视为失败则得到严格下限 61/124 = 49.2%——仍然高于所有 Mini-SWE-Agent 排行榜条目。所有验证器日志均已包含,以便您可以应用任一约定。
复现
git clone https://github.com/scaleapi/SWE-Atlas && cd SWE-Atlas
git clone --branch v0.18.0 --depth 1 https://github.com/laude-institute/harbor.git
uv tool install ./harbor --with modal && uv tool install modal && modal setup
# 从本仓库:将 run_config/qa, run_config/tw, run_config/rf 复制到
# SWE-Atlas/run_config/(保持子目录结构——脚本解析相对于自身位置的
# .env 和 Scale 的 mswea_*_config.yaml),将 preflight.sh 和 .env.example
# 复制到 SWE-Atlas 根目录,从 .env.example 创建 .env,然后:
./preflight.sh
bash run_config/qa/big-pickle_smoke.sh # 先进行 3 个任务的烟雾测试
bash run_config/qa/big-pickle_miniswe.sh # 完整的 124 个任务运行
配置中已处理的棘手注意事项:
- 不要对带有
openai/前缀的模型传递--ak reasoning_effort——Harbor 会静默地将 mini-swe-agent 切换到 OpenAI Responses API,而像 Zen 这样的纯 chat-completions 端点不提供此服务。 - 保持代理和裁判凭证分开。 裁判读取主机的
OPENAI_API_KEY/OPENAI_API_BASE(通过每个任务的[verifier.env]);代理的 Zen 凭证通过--ae逐代理覆盖传递。 - 将密钥作为
${VAR}模板传递给--ae,而不是直接量。 Harbor 在保存作业状态时会将直接量密钥重写为****,这会导致harbor job resume立即出现 401 错误。模板可以往返并在主机环境中重新解析。 - 预计会有少量百分比的试验因 Modal
Failed to read exec stdio stream错误而死亡;harbor job resume -f ...可以干净地重新运行它们。
完整问答运行的大致成本:约 $70 的 Modal 计算(沙箱资源缩减后;在声明的 16 CPU/16 GB 下大约 2-3 倍),约 $25 的 Anthropic API 裁判费用,模型费用为 $0。
仓库内容
results/per_task_results.csv— 任务 ID、类别、语言、是否解决、综合评分标准得分、通过的评分标准数/总评分标准数results/summary.json— 标题数字和细分数据results/verifier_logs/— 裁判对每个任务的完整逐评分标准输出(审计线索)。诸如(flipped from raw=0)的注释是基准自带的验证器逻辑(evaluate_answer.py会反转标记为负极性的评分标准),而非事后重新评分。run_config/— 使用的确切 Harbor 运行脚本(问答烟雾测试 + 完整运行,以及未经测试的测试编写/重构变体)preflight.sh— 模型和裁判的端点/认证检查
致谢
- SWE Atlas (https://github.com/scaleapi/SWE-Atlas) 基准 © Scale AI, Apache-2.0 — 论文:arXiv:2605.08366 (https://arxiv.org/abs/2605.08366)。根据作者的要求,请将 SWE Atlas 视为进展的保留信号,而非训练目标。
- Harbor (https://github.com/laude-institute/harbor) (Laude Institute) 和 mini-swe-agent (https://github.com/SWE-agent/mini-swe-agent) (SWE-agent team)。
- big-pickle 由 OpenCode Zen (https://opencode.ai/docs/zen/) 提供服务。本仓库中的评估配置和结果采用 MIT 许可证。
相似文章
AA 推出 Coding Agent Index —— 模型与 Harness 组合的性能对比
Artificial Analysis 推出了 Coding Agent Index,这是一套新的基准测试套件,结合了 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,旨在评估 AI 编程代理在多样化任务中的表现。
@no_stp_on_snek: 在Poolside自有的agent(pool)中对Laguna S 2.1进行了此操作,指向DGX Spark上的本地实例,使用提示词…
两个AI编码智能体构建马里奥游戏的对比:Poolside agent中的Laguna S 2.1耗时62分钟,具备自我纠正能力并通过测试,而之前的Qwen模型耗时数小时且需要人类帮助;突出展示了oracle纪律和原生测试框架的优势。
@jtdavies: 在小模型上编程... 我的4xDGX Spark集群的默认模型是@UnslothAI的Qwen3.6-35B-A3B-NVFP4。我获得了极好…
一位用户测试了多种小型AI模型进行编程任务,发现Qwen3.6-27B-NVFP4在速度和准确性之间取得了最佳平衡,并指出这些模型在Java上的表现较差。
Agent Arena Code - GLM 和 Qwen 的初步表现非常出色!
Agent Arena Code 的初步结果显示 GLM 和 Qwen 模型表现良好,这表明开放权重的AI模型取得了进步。
一款名为 Ox-Alpha 的隐秘模型已经发布,在 SWE 上表现优于 Fable。
一款名为 Ox-Alpha 的隐秘AI模型据报告已经发布,在 SWE 基准测试中优于 Fable,并且可以免费使用,具备多模态支持和零数据保留等功能。