@Howaboua: 我用Sol来识别Ox-Alpha……太厉害了。立刻就知道该从哪里下手。
摘要
一位Twitter用户分享了使用Sol识别Ox-Alpha的积极体验,突出了其快速而准确的分析。
我用Sol来识别Ox-Alpha……
太厉害了。立刻就知道该从哪里下手。 https://t.co/XpLJpyG4dL
查看缓存全文
缓存时间: 2026/08/22 23:29
我派Sol去识别Ox-Alpha…
太凶残了。一眼就找到要怼的地方。https://t.co/XpLJpyG4dL
相似文章
Ox Alpha刚刚完成了完整的DeepSWE运行。最终得分:约63%。供参考:• DeepSeek V4 Pro → 63% • Grok 4.6 → 65% …
Ox Alpha,一个拥有100万上下文的免费模型,在DeepSWE基准测试中获得了约63%的分数,匹配了前沿中端模型,并暗示了本地AI智能体开发的潜力。
@omarsar0: 这是一个很棒的模型。我一直在用它配合Pi玩得很开心。你可以通过Pi或Hermes Agent免费在我们的…测试Ox Alpha。
Ox Alpha被描述为OpenRouter上最受欢迎的免费推理模型,具有1M令牌上下文窗口,适用于编码和代理任务,并可通过Pi或Hermes Agent进行测试。
发现了 Ox Alpha 背后的模型。它是未发布的 z.ai GLM 模型。
文章揭示了 Ox Alpha 基于 z.ai 的未发布 GLM 模型,通过分词器和图像编码器中匹配的 token 尺寸得到验证。
我在SWE-bench Verified Mini(50个任务)上基准测试了Ox Alpha:96%的问题已解决。现在我对自己产生了怀疑。
作者在SWE-bench Verified Mini上对Ox Alpha进行了基准测试,达到了96%的解决率,但对分数的有效性提出了担忧,原因包括数据污染、小样本量和不可比较的基线。
Ox Alpha 实在太强了
Ox Alpha 已在 OpenRouter 上免费发布,因其出色的性能而受到赞誉,用户将其与其他顶级模型如 GPT-5.6 和 Fable 5 进行了比较。