Ox Alpha刚刚完成了完整的DeepSWE运行。最终得分:约63%。供参考:• DeepSeek V4 Pro → 63% • Grok 4.6 → 65% …

X AI KOLs Timeline 模型

摘要

Ox Alpha,一个拥有100万上下文的免费模型,在DeepSWE基准测试中获得了约63%的分数,匹配了前沿中端模型,并暗示了本地AI智能体开发的潜力。

Ox Alpha刚刚完成了完整的DeepSWE运行。 最终得分:约63% 供参考: • DeepSeek V4 Pro → 63% • Grok 4.6 → 65% • Gemini 3.7 Flash → 65% 这是一个拥有100万上下文的免费无名模型,正在匹配前沿中端模型。 如果GLM-5.x Flash的传言属实,并且这可以在1-2台DGX Sparks上运行… 本地智能体游戏刚刚改变了。
查看原文
查看缓存全文

缓存时间: 2026/08/23 15:40

Ox Alpha 刚刚完成了完整的 DeepSWE 测试运行。

最终得分:约 63%

参考对比: • DeepSeek V4 Pro → 63% • Grok 4.6 → 65% • Gemini 3.7 Flash → 65%

这是一款免费的无名模型,具备百万级上下文长度,其表现已接近前沿中端模型水准。

若 GLM-5.x Flash 的传闻属实,且该模型能在 1-2 台 DGX Sparks 上运行…

本地代理格局就此改变。

相似文章

有人对新DeepSWE进行了审计,结果不太好看

Reddit r/singularity

DeepSWE是一个新的基准测试,用于评估AI编程代理在来自活跃开源仓库的真实软件工程任务上的表现,包含113个任务,涵盖TypeScript、Go、Python、JavaScript和Rust,提供隔离环境和基于程序的验证器。