大泡菜在SWE Atlas上的表现——代码库问答

Hacker News Top 模型

摘要

免费隐形AI模型'大泡菜'在Scale AI的SWE Atlas代码库问答基准测试中,使用mini-swe-agent脚手架达到了50.8%的解决率,性能超越同级别其他模型。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/16 03:41

PhillipChaffee/big-pickle-swe-atlas 来源: https://github.com/PhillipChaffee/big-pickle-swe-atlas

Big Pickle 在 SWE Atlas 上的评测 — 代码库问答

任务解决率: 50.8% (63/124)big-pickle (https://opencode.ai/docs/zen/),这是 OpenCode Zen 上的免费隐蔽模型,在 Scale AI 的 SWE Atlas (https://github.com/scaleapi/SWE-Atlas) 代码库问答基准上,使用 mini-swe-agent 脚手架进行评测。运行于 2026-08-11,使用官方开源工具、任务数据和裁判模型。

在上下文中的结果

对照官方 SWE Atlas 问答排行榜 (https://labs.scale.com/leaderboard/sweatlas-qna) (更新于 2026-07-28):

模型 (脚手架)任务解决率
Opus 5 (Claude Code, xHigh)63.17
Opus 4.8 (Claude Code, xHigh)57.26
big-pickle (Mini-SWE-Agent) — 本次运行50.81
GLM 5.2 (Mini-SWE-Agent)48.12
GPT-5.6-Sol (Codex, xHigh)46.00
GPT 5.5 (Codex, xHigh)45.43

在 Mini-SWE-Agent 脚手架类别中——即同类对比——本次运行 得分高于官方排行榜上的所有条目,并且也超过了 Codex 脚手架的 GPT 条目。只有两个运行在其原生 Claude Code 脚手架上的 Claude 模型得分更高。

注意:在将此视为与排行榜等效的数据之前,请阅读以下注意事项。

按语言分类

语言解决数解决率
TypeScript18/3158.1%
Python16/2955.2%
Go19/3850.0%
C10/2638.5%

按类别分类

类别解决数解决率
代码入门17/2860.7%
架构与系统设计23/4452.3%
根本原因分析17/3745.9%
安全性5/1145.5%
API 与库用法/集成1/425.0%

方法

一切均尽可能遵循 Scale 公布的协议,预算允许的范围内:

  • 任务: 全部 124 个来自 scaleapi/SWE-Atlas (https://github.com/scaleapi/SWE-Atlas) (Apache-2.0) 的代码库问答任务,未经修改——包括 Scale 随附的 mswea_qa_config.yaml 代理配置(系统/实例模板,step_limit: 250)。
  • 工具: Harbor (https://github.com/laude-institute/harbor) v0.18.0,配合 Modal 沙箱,如 SWE-Atlas README 所述。
  • 脚手架: mini-swe-agent (https://github.com/SWE-agent/mini-swe-agent) 固定在版本 2.4.6 ——与 Scale 用于排行榜非第一方模型使用的最小化纯 bash 脚手架相同。
  • 模型: big-pickle,通过 OpenCode Zen 的 OpenAI 兼容端点 (https://opencode.ai/zen/v1) 访问,litellm 路由为 openai/big-pickle。总消耗:674M 输入 / 4.3M 输出 tokens,费用为 $0(该模型在隐蔽期内免费)。
  • 裁判模型: claude-opus-4-5-20251101 —— Scale 指定的精确裁判模型——通过 Anthropic 的 OpenAI 兼容端点 (https://api.anthropic.com/v1) 访问,并将 EVAL_MODEL 覆盖为纯 Anthropic 模型 ID。
  • 评分: 基准自身的基于评分标准的验证器,未经修改。任务仅在通过所有必须项的评分标准后才算解决。

注意事项

在引用该数字之前,请阅读以下内容:

  1. 每个任务仅运行一次 (-k 1)。官方协议运行 3 次并报告平均值。在 n=124 的情况下,单次运行的标准误差约为 ±4.5 分——与排行榜自身报告的误差范围 (±5) 相当。
  2. 沙箱资源缩减。 任务声明需要 16 CPU / 16 GB 内存;本次运行为适应个人预算使用了 4 CPU / 8 GB。较慢的命令执行只会通过命令超时或 OOM 终止来降低代理得分,而不会使其虚高。经验上看来这里似乎没有影响:对全部 124 个代理轨迹的扫描发现了零命令超时和零 exit-137 终止——没有任何命令达到 900 秒上限或内存限制。
  3. 自报数据。 Scale 未运行或验证此评估。本仓库中包含完整的逐任务验证器日志,可供独立审计,本次运行可从这里的配置加上公开的 SWE-Atlas 仓库复现。
  4. 模型身份未知。 big-pickle 官方未确认;泄露的提供商错误和 API 响应特征表明其目前由 DeepSeek 基础设施提供服务。底层模型可能会在不通知的情况下更改,因此此结果是 2026-08-11 那个别名背后模型的快照。
  5. 数据暴露。 OpenCode 表示,在免费期间发送给 big-pickle 的提示可能会被用于改进模型。基准的任务内容(已经公开,由 Scale 添加金丝雀标记)必须发送到该端点。
  6. 两个已解决任务的评分标准未评分。task-...ba9ad(11 个评分标准中有 5 个)和 task-...baa1d(1 个评分标准)上,裁判在全部 8 次重试中均返回了无法解析的输出;基准的验证器按设计将未评分标准排除在通过计算之外。将未评分视为失败则得到严格下限 61/124 = 49.2%——仍然高于所有 Mini-SWE-Agent 排行榜条目。所有验证器日志均已包含,以便您可以应用任一约定。

复现

git clone https://github.com/scaleapi/SWE-Atlas && cd SWE-Atlas
git clone --branch v0.18.0 --depth 1 https://github.com/laude-institute/harbor.git
uv tool install ./harbor --with modal && uv tool install modal && modal setup
# 从本仓库:将 run_config/qa, run_config/tw, run_config/rf 复制到
# SWE-Atlas/run_config/(保持子目录结构——脚本解析相对于自身位置的
# .env 和 Scale 的 mswea_*_config.yaml),将 preflight.sh 和 .env.example
# 复制到 SWE-Atlas 根目录,从 .env.example 创建 .env,然后:
./preflight.sh
bash run_config/qa/big-pickle_smoke.sh  # 先进行 3 个任务的烟雾测试
bash run_config/qa/big-pickle_miniswe.sh # 完整的 124 个任务运行

配置中已处理的棘手注意事项:

  • 不要对带有 openai/ 前缀的模型传递 --ak reasoning_effort——Harbor 会静默地将 mini-swe-agent 切换到 OpenAI Responses API,而像 Zen 这样的纯 chat-completions 端点不提供此服务。
  • 保持代理和裁判凭证分开。 裁判读取主机的 OPENAI_API_KEY/OPENAI_API_BASE(通过每个任务的 [verifier.env]);代理的 Zen 凭证通过 --ae 逐代理覆盖传递。
  • 将密钥作为 ${VAR} 模板传递给 --ae,而不是直接量。 Harbor 在保存作业状态时会将直接量密钥重写为 ****,这会导致 harbor job resume 立即出现 401 错误。模板可以往返并在主机环境中重新解析。
  • 预计会有少量百分比的试验因 Modal Failed to read exec stdio stream 错误而死亡;harbor job resume -f ... 可以干净地重新运行它们。

完整问答运行的大致成本:约 $70 的 Modal 计算(沙箱资源缩减后;在声明的 16 CPU/16 GB 下大约 2-3 倍),约 $25 的 Anthropic API 裁判费用,模型费用为 $0。

仓库内容

  • results/per_task_results.csv — 任务 ID、类别、语言、是否解决、综合评分标准得分、通过的评分标准数/总评分标准数
  • results/summary.json — 标题数字和细分数据
  • results/verifier_logs/ — 裁判对每个任务的完整逐评分标准输出(审计线索)。诸如 (flipped from raw=0) 的注释是基准自带的验证器逻辑(evaluate_answer.py 会反转标记为负极性的评分标准),而非事后重新评分。
  • run_config/ — 使用的确切 Harbor 运行脚本(问答烟雾测试 + 完整运行,以及未经测试的测试编写/重构变体)
  • preflight.sh — 模型和裁判的端点/认证检查

致谢

  • SWE Atlas (https://github.com/scaleapi/SWE-Atlas) 基准 © Scale AI, Apache-2.0 — 论文:arXiv:2605.08366 (https://arxiv.org/abs/2605.08366)。根据作者的要求,请将 SWE Atlas 视为进展的保留信号,而非训练目标。
  • Harbor (https://github.com/laude-institute/harbor) (Laude Institute) 和 mini-swe-agent (https://github.com/SWE-agent/mini-swe-agent) (SWE-agent team)。
  • big-pickle 由 OpenCode Zen (https://opencode.ai/docs/zen/) 提供服务。本仓库中的评估配置和结果采用 MIT 许可证。

相似文章