Ox Alpha刚刚完成了完整的DeepSWE运行。最终得分:约63%。供参考:• DeepSeek V4 Pro → 63% • Grok 4.6 → 65% …
摘要
Ox Alpha,一个拥有100万上下文的免费模型,在DeepSWE基准测试中获得了约63%的分数,匹配了前沿中端模型,并暗示了本地AI智能体开发的潜力。
查看缓存全文
缓存时间: 2026/08/23 15:40
Ox Alpha 刚刚完成了完整的 DeepSWE 测试运行。
最终得分:约 63%
参考对比: • DeepSeek V4 Pro → 63% • Grok 4.6 → 65% • Gemini 3.7 Flash → 65%
这是一款免费的无名模型,具备百万级上下文长度,其表现已接近前沿中端模型水准。
若 GLM-5.x Flash 的传闻属实,且该模型能在 1-2 台 DGX Sparks 上运行…
本地代理格局就此改变。
相似文章
一款名为 Ox-Alpha 的隐秘模型已经发布,在 SWE 上表现优于 Fable。
一款名为 Ox-Alpha 的隐秘AI模型据报告已经发布,在 SWE 基准测试中优于 Fable,并且可以免费使用,具备多模态支持和零数据保留等功能。
我在SWE-bench Verified Mini(50个任务)上基准测试了Ox Alpha:96%的问题已解决。现在我对自己产生了怀疑。
作者在SWE-bench Verified Mini上对Ox Alpha进行了基准测试,达到了96%的解决率,但对分数的有效性提出了担忧,原因包括数据污染、小样本量和不可比较的基线。
有人对新DeepSWE进行了审计,结果不太好看
DeepSWE是一个新的基准测试,用于评估AI编程代理在来自活跃开源仓库的真实软件工程任务上的表现,包含113个任务,涵盖TypeScript、Go、Python、JavaScript和Rust,提供隔离环境和基于程序的验证器。
DeepSWE基准测试显示,DeepSeek v4 Pro仅通过8%的任务
关于DeepSWE基准测试的讨论显示,DeepSeek v4 Pro仅通过了8%的任务,与它在类似任务上的表现相比,这个分数低得令人惊讶。
@VictorKaiWang1:在 Terminal Bench 2.1 上达到 95.3%,DeepSeek V4 Flash + StateM,在 TB2.1 上为 88.8%
研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。