Ornith-1.5 9B 可能并不差

Reddit r/LocalLLaMA 模型

摘要

作者对包括Ornith-1.5 9B在内的几个AI模型进行了评测,任务涉及生成医学物理脚本,发现Ornith表现最佳,成功解决了6个任务中的5个。

(我的个人经验) 我有一台2024年的中端游戏笔记本,配备4GB显存和16GB内存。除了以较低的t/s速度运行小型模型外,我无法运行其他任何模型。我主要用这些模型生成医学物理研究的脚本(别担心,我每次使用前都会验证,不会有人被汽化的)。我的“基准测试”包括6个典型任务,没有什么太花哨的。我试过Ling-3.0 Tiny、Qwen 3.5 4B、Empero's的2B和4B蒸馏模型,以及现在Ornith的新9B模型。3.5 4B表现最差,只解决了2/6任务,Ling和Empero's解决了3/6,无论怎么反馈都无法让其他3个任务运行。Ornith一次性解决了5/6任务,没有问题。它无法完成其中一个任务,但接受了反馈并改进了部分代码,是这组模型中第一个做到的。它还正确回答了洗车问题!
查看原文

相似文章

ornith-ai/Ornith-1.5-9B

Hugging Face Models Trending

Ornith-1.5-9B 是一款9B参数密集型AI模型,通过端到端自我改进来推进基础模型构建,并利用强化学习优化任务生成、框架构建和解决方案部署。它在与Qwen和Gemma等其他模型相比时,在各种基准测试上表现出竞争力性能。

ornith-ai/Ornith-1.5-35B-A3B

Hugging Face Models Trending

Ornith-1.5-35B-A3B 是一种混合专家AI模型,每个令牌仅激活30亿参数,并在编码和代理基准测试中超越了类似规模的模型,如Qwen和Gemma。

ornith-ai/Ornith-1.5-9B-GGUF

Hugging Face Models Trending

Ornith-1.5是一款新的AI模型,它通过强化学习引入了端到端的自我改进,针对单GPU和边缘设备的高效部署进行了优化。