标签
推文对比了Qwen 3.8 27B和Ornith-1.5-35B模型在生成生物发光深渊神庙动画的提示词上的表现,指出Qwen在视觉效果上更优,而Ornith在构建速度和完成时间上更快。
用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。
推文突出了 SWE-bench_pro 基准测试中参数低于 128B 的顶级 AI 模型,指出阿里 Qwen 3.6 27B 和 ornith 35B 是领先的竞争者。
Ornith-9B证明了在90亿参数规模下,RL训练主要带来的是效率提升:仅用约56%的token和两倍于基础模型的速度就能得到相同答案,为按token付费的方式提供了实实在在的成本节约。
Ornith-1.0是一个专注于agentic编码的开源LLM系列,提供9B到397B MoE的多种大小,可通过Ollama运行,以便与Claude或Pi等工具一起使用。
一项并排画布测试,对比了Qwen 3.5 35B A3B和Ornith 1.0 35B在三种纸张销毁任务(切割、碎纸、揉团)上的表现,Ornith取得决定性胜利,展示了在Qwen 3.5和Gemma 4上进行后训练的价值。
中国发布了一个名为Ornith的开源编程AI大模型,35B版本击败了Qwen3.6,397B版本基准测试接近Claude Opus 3.7。