DeepReinforce 发布 Ornith-1.0 开源编程模型(2分钟阅读)

TLDR AI 模型

摘要

DeepReinforce 开源了 Ornith-1.0,这是一系列自我改进的编程模型,参数从 9B 到 397B 不等,基于 Gemma 4 和 Qwen 3.5 基础模型训练,采用了一种新颖的强化学习方法,能够学习生成自己的脚手架。

Ornith-2.0 是一个能够编写 RL 脚手架的编程模型系列。每个变体都在预训练的 Gemma 4 和 Qwen 3.5 基础模型之上进行训练。Ornith-1.0 在同等规模的开源模型中达到了最先进的水平。权重和技术报告可在 Hugging Face 上获取,供希望直接运行或研究模型的团队使用。
查看原文
查看缓存全文

缓存时间: 2026/06/26 17:10

# DeepReinforce 发布 Ornith-1.0 开源编码模型 来源:https://www.testingcatalog.com/deepreinforce-releases-ornith-1-0-open-source-coding-models/ Google 优选来源 (https://google.com/preferences/source?q=testingcatalog.com) DeepReinforce 已开源 Ornith-1.0,这是一个面向智能体编码的自改进模型系列。该版本覆盖完整规模范围:从适用于边缘部署的紧凑型 9B Dense 版本,到面向前沿级任务的 397B MoE 模型,中间还包括 31B Dense 和 35B MoE 两种选择。每个变体均在预训练的 Gemma 4 和 Qwen 3.5 基础之上进行训练。 ## Ornith-1.0 的独特之处 Ornith-1.0 与大多数强化学习设置的区别在于它对"支架"(scaffold)的处理方式。模型不依赖人工设计的"缰绳"来引导解决方案生成,而是自行学习生成解决方案的 rollout 以及指导这些 rollout 的任务特定支架。每个强化学习步骤分两个阶段运行:根据当前任务及上次使用的支架,模型先提出一个改进后的支架,然后基于该支架生成解决方案。来自 rollout 的奖励会反向传播到两个阶段,因此模型既学习编写编排逻辑,也学习给出答案。在训练过程中反复迭代,支架会不断变异和选择,最终收敛到能产生更优奖励轨迹的那些,而每个任务的策略也会自行浮现,无需人工设计缰绳。 ## 防奖励黑客的三层防御 让模型自行编写支架会打开奖励黑客攻击的路径——支架可能通过验证器而不真正完成任务。DeepReinforce 描述了三层防御机制: 1. 固定的外部信任边界:确保环境和测试隔离在模型的可及范围之外。 2. 确定性监控器:标记试图读取被屏蔽路径或修改验证脚本的行为。 3. 冻结的 LLM 评判器:当在允许的工具表面内部出现"夺权"行为时,否决验证器。 ## 性能表现 在性能方面,DeepReinforce 将 Ornith-1.0 定位为开源模型中同等规模里最先进的。公司报告称,397B 旗舰模型在 Terminal-Bench 2.1 上达到 77.5,在 SWE-Bench Verified 上达到 82.4,与 Claude Opus 4.7 以及 MiniMax M3、DeepSeek-V4-Pro 等顶级开源同类模型持平。35B 模型据称可超越同等规模的 Qwen 和 Gemma 构建,而 9B 版本在 Terminal-Bench 2.1 上获得 43.1,在 SWE-Bench Verified 上获得 69.4,并可与大得多的模型(如 Gemma 4-31B)相媲美,这使得资源受限的硬件也能进行高效的编码任务。 ## 关于 DeepReinforce DeepReinforce 是该成果背后的 AI 实验室,一个公开发表强化学习研究的团队,此前曾发布 CUDA-L1 等工作,并推出了面向代码智能体的 IterX 优化循环。Ornith-1.0 通过将支架构建融入训练过程本身,进一步推进了这一方向。权重和技术报告已在 Hugging Face 上发布,供希望直接运行或研究这些模型的团队使用。

相似文章

deepreinforce-ai/Ornith-1.0-9B

Hugging Face Models Trending

deepreinforce-ai 发布了 Ornith-1.0,一个开源编码代理模型系列,在编码基准测试上实现了最先进的性能,提供从 9B 到 397B 的参数规模,采用自我改进训练框架和 MIT 许可证。

deepreinforce-ai/Ornith-1.0-35B-GGUF

Hugging Face Models Trending

deepreinforce-ai 发布了 Ornith-1.0-35B-GGUF,这是一个最先进的开源编程智能体模型,它使用自我改进的强化学习来联合优化框架和解决方案生成,在编程基准测试上达到了SOTA性能。

Ornith-1.0:用于智能代理编码的自我构建型大语言模型

Hacker News Top

Deep Reinforce发布了Ornith-1.0系列开源自我改进大语言模型,专为智能代理编码设计,参数规模从9B到397B,在SWE-Bench Verified和Terminal-Bench 2.1等基准测试中取得了最先进的性能,超越了Claude Opus 4.7及其他领先的开源模型。