Ornith 1.5:9B密集模型与35B/397B MoE模型

Reddit r/LocalLLaMA 模型

摘要

Ornith-1.5是一系列开源大语言模型,拥有9B、35B和397B参数,通过自我改进策略在推理、智能体和编程任务上达到最先进性能。

大家好!介绍Ornith-1.5,一系列开源大语言模型,涵盖9B密集模型、35B MoE和397B MoE,采用自我改进策略训练。 它在同等规模的开源模型中达到了最先进性能,并且在推理、智能体和编程任务上性能可与Claude Opus 4.8媲美: Terminal-Bench 2.1 (86.1) SWE-Bench (86 on verified, 65.1 on pro, 79.6 on Multilingual) DeepSWE (56) HLE (44.6) ClawEval (81.4) Tool Decathlon (71.2) Ornith-1.5在通过端到端自我改进训练基础模型方面迈出重要一步,将Ornith-1.0中引入的自我脚手架策略扩展为更完整的自我改进循环:模型提出新任务,生成特定任务的脚手架,并为强化学习生成解决方案展开,不断创造新的学习经验以从中改进。 所有模型及其量化版本(FP8、GGUF、MLX和NVFP4)已根据MIT许可证发布,允许无限制的商业和研究使用。 技术博客:http://ornith.ai/ornith_1_5.html Huggingface:http://huggingface.co/collections/ornith-ai/ornith-15…
查看原文
查看缓存全文

缓存时间: 2026/08/19 14:41

Aloha!隆重介绍Ornith-1.5——一系列开源大语言模型,涵盖9B密集参数、35B混合专家(MoE)及397B混合专家版本,通过自提升策略训练而成。

该系列在同等规模开源模型中达到最先进性能,并在推理、智能体及编程任务中展现出与Claude Opus 4.8媲美的表现: Terminal-Bench 2.1(86.1) SWE-Bench(验证集86分,专业集65.1分,多语言集79.6分) DeepSWE(56) HLE(44.6) ClawEval(81.4) Tool Decathlon(71.2)

Ornith-1.5在通过端到端自提升训练基础模型的道路上迈出关键一步,将Ornith-1.0引入的自脚手架策略扩展为更完整的自提升闭环:模型主动提出新任务、生成针对性脚手架结构、产出解决方案用于强化学习,持续创造新的学习经验以实现自我改进。

所有模型及其量化版本(FP8、GGUF、MLX和NVFP4)均以MIT许可证发布,可无限制用于商业与研究用途。 技术博客:http://ornith.ai/ornith_1_5.html Huggingface:http://huggingface.co/collections/ornith-ai/ornith-15…


Ornith-1.5:从自脚手架到自提升

来源:https://ornith.ai/ornith_1_5.html 今日我们推出Ornith-1.5,这是通过端到端自提升构建基础模型的重要里程碑。Ornith-1.5将Ornith-1.0引入的自脚手架框架扩展为更完整的自提升闭环:模型提出新任务、生成针对性脚手架、产出解决方案用于强化学习,持续创造新的学习经验以实现自我改进。

Ornith-1.5涵盖三种模型规模:397B混合专家(MoE)、35B混合专家(MoE)和9B密集参数模型。该系列专为跨推理、智能体及编程任务的强通用智能设计,在众多基准测试中达到同等规模开源模型的最先进水平。Ornith-1.5-397B在Terminal-Bench 2.1获得86.1分,DeepSWE获得56.0分,性能与Claude Opus 4.8(85.0分和59.0分)持平,并超越包括GLM-5.2(82.7分和46.2分)、DeepSeek-V4-Flash-0731(82.7分和54.4分)在内的同级领先开源模型。而在另一端,Ornith-1.5-9B及其量化版Ornith-1.5-9B-Mobile可直接部署于iPhone和Android设备,同时显著超越Gemma 4-31B、Qwen 3.6-35B等更大规模模型。

Ornith-1.5-397B性能评估结果 在旗舰规模,Ornith-1.5-397B在Terminal-Bench 2.1获得86.1分,DeepSWE获得56分,与Claude Opus 4.8在两项基准测试中表现相当,并超越GLM-5.2、DeepSeek-V4-Flash-0731等同级领先开源模型。

Ornith-1.5-35B性能评估结果 Ornith-1.5-35B在所有编程与智能体基准测试中显著超越同等规模的Qwen 3.6-35B,且尽管每个词元仅激活3B参数,其在智能体编程任务中的表现(Terminal-Bench 2.1得68.5分,SWE-Bench Verified得79.0分)仍大幅领先密集参数模型Gemma 4-31B(43.4分和52.0分)与Meta的Muse Glimmer-30B(51.7分和76.0分)。

Ornith-1.5-9B性能评估结果 可边缘部署的Ornith-1.5-9B同样表现卓越,在Terminal-Bench 2.1获得47.0分,SWE-Bench Verified获得70.6分。尽管作为紧凑的9B参数模型,其性能匹配甚至超越Gemma 4-31B、Qwen 3.6-35B等更大规模模型。

通过自生成任务、工具与解决方案实现自我提升

Ornith-1.5将Ornith-1.0的自提升闭环从脚手架与解决方案优化扩展到同时优化任务生成、脚手架构建与解决方案产出。系统不依赖固定的人工策划任务集与手工设计工具,而是持续生成新的训练任务、发现有效的解决方案策略,并通过强化学习优化策略。

每个训练周期分为三个阶段。基于环境或代码库、任务类型高层指令及模型历史任务求解记录,系统会提出逐步超越模型已解决能力范围的递进式任务,暴露能力缺口并持续推动训练前沿。

针对每个任务,模型生成或优化特定任务的脚手架——包括解决问题所需的指令、工具、分解策略与编排流程。基于任务与脚手架,策略生成解决方案。解决方案的奖励会反向传播至所有三个阶段,使系统不仅能学习生成更优解决方案,还能学习生成更有价值的训练任务并构建更高效的脚手架。

通过持续训练形成闭环自提升:更强的策略能生成更具挑战性与信息量的任务,演进的脚手架能发掘更好的能力激发方式,更高质量的解决方案提供更有效的学习信号。Ornith-1.5不再依赖静态训练分布或手工设计智能体架构,而是持续扩展自身课程并调整问题解决策略,推动推理、编程与智能体任务的持续能力提升。

Ornith-1.5通过生成任务、脚手架、解决方案、奖励及GRPO更新形成的自提升闭环

任务奖励

针对问题→脚手架→解决方案的流程,我们通过三个信号定义任务奖励:有效性、前沿难度与新颖性。设q为生成的问题,s为其脚手架,\{\tau_i\}_{i=1}^N为解决方案集合,定义:

[ R_{\text{task}} = \underbrace{V(q,s)}{\text{是否有效且可验证?}} \times \underbrace{D!\left(q,s,{\tau_i}{i=1}^N\right)}{\text{难度是否合适?}} \times \underbrace{N(q)}{\text{新颖性是否充足?}} ]

其中V衡量生成的任务与脚手架是否构成有效且可验证的学习环境,D基于解决方案表现衡量任务是否接近模型当前能力前沿,N衡量相对于历史生成/训练任务的新颖度。乘积式设计旨在鼓励生成器同时满足三个特性:有效、难度适中、非冗余

有效性与可验证性

有用的任务必须构成明确定义的学习环境。问题需连贯可解,脚手架需正确执行并可靠评估候选解决方案。定义:

[ V(q,s) \in [0,1] ]

基于脚本运行是否成功、高置信度方案是否通过、明显错误方案是否失败、评估结果是否符合任务规范等检查。有效性可作为硬性门槛:

[ V(q,s)=0 \quad\Rightarrow\quad R_{\text{task}}=0 ]

这防止畸形任务或不可靠脚手架仅因表面难度获得奖励。

前沿难度

在有效任务中,最有价值的任务既非 trivial 也非 impossible。我们直接从模型解决方案估计难度。

对每个任务,采样N个解决方案并计算经验成功率:

[ p = \frac{1}{N} \sum_{i=1}^{N} \mathbf{1}!\left[s(q,\tau_i)=\text{success}\right] ]

随后对成功率接近目标前沿p^*的任务给予奖励:

[ D(q,s,{\tau_i}) = \exp!\left(-\frac{(p-p^*)^2}{2\sigma^2}\right) ] p^*设为0.2,旨在倾向于选择具有挑战性但仍能产出足够成功轨迹用于强化学习的任务。随着模型改进并能更可靠地解决任务,其奖励自然降低,推动生成器转向更难的问题。

新颖性与多样性

仅考虑前沿难度可能导致模型重复生成同类任务的微小变体。因此添加新颖性项:

[ N(q) = 1 - \max_{q_j \in \mathcal{B}} \operatorname{sim}(q,q_j) ] 其中\mathcal{B}为历史生成/训练任务缓冲区。新颖性应作为有效性和难度的辅助:其作用是减少冗余,而非奖励任意非常规任务。

这些信号共同鼓励生成器产出有效、可验证、具有挑战性但可学习、且多样性充足的任务。由于前沿难度通过当前模型自身解决方案测量,生成的课程体系会随模型能力自动演进。

脚手架与解决方案奖励

对于生成的问题q,脚手架h的奖励基于其提供的评估环境是否与任务对齐、忠于解决方案质量、且能抵御奖励黑客攻击

[ R_{\text{harness}} = \underbrace{C(q,h)}{\text{任务对齐度}} \times \underbrace{F!\left(h,{\tau_i}\right)}{\text{奖励保真度}} \times \underbrace{H(h)}_{\text{抗攻击性}} ] 其中C衡量脚手架是否忠实反映任务规范,F衡量其奖励是否准确追踪候选解决方案质量,H衡量其对评估器故障、捷径策略和奖励黑客行为的抵抗力。

每个解决方案\tau_i由生成的脚手架直接评分:

[ R_{\text{rollout}}(\tau_i) = \underbrace{h(q,\tau_i)}_{\text{任务成功度}} ] 对于可验证任务,这可以是二元通过/失败奖励;对于复杂环境,可综合评估正确性、任务完成度、效率与约束满足度。问题生成、脚手架生成与解决方案产出均通过各自奖励使用GRPO进行优化,使三个阶段能在同一自提升闭环中协同改进。

完整表格

Ornith-1.5-397B

Ornith-1.5-35B

Ornith-1.5-9B

脚注

相似文章

Ornith-1.0 在 Hugging Face 上发布

Reddit r/LocalLLaMA

Ornith-1.0 已在 Hugging Face 上发布,包含一系列模型,参数范围从 9B 到 397B,涵盖密集和 MoE 架构,声称在各项基准测试中达到 SOTA 性能。

Ornith-1.0:用于智能代理编码的自我构建型大语言模型

Hacker News Top

Deep Reinforce发布了Ornith-1.0系列开源自我改进大语言模型,专为智能代理编码设计,参数规模从9B到397B,在SWE-Bench Verified和Terminal-Bench 2.1等基准测试中取得了最先进的性能,超越了Claude Opus 4.7及其他领先的开源模型。

deepreinforce-ai/Ornith-1.0-9B

Hugging Face Models Trending

deepreinforce-ai 发布了 Ornith-1.0,一个开源编码代理模型系列,在编码基准测试上实现了最先进的性能,提供从 9B 到 397B 的参数规模,采用自我改进训练框架和 MIT 许可证。