标签
一次仅花费500美元的RL微调,使9B开源模型在目录审核质量上达到87%,每1000条列表成本仅0.50美元,显著优于GPT-4和Claude等前沿模型(成本19-172美元,质量仅70-76%)。
Qwythos-9B 是一款基于 Qwen3.5-9B 底座、用 5 亿+ Claude Mythos 推理轨迹二次训练的 9B 超强推理模型,原生支持 1M 长上下文和工具调用,专为安全研究员本地部署设计,在 MMLU 和数学推理上大幅领先原版底座。
讨论关于阿里巴巴潜在的开源权重发布Qwen 3.7 9B,以及寻找Qwen 3.5 9B的本地部署替代品。
一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。
Ornith-9B证明了在90亿参数规模下,RL训练主要带来的是效率提升:仅用约56%的token和两倍于基础模型的速度就能得到相同答案,为按token付费的方式提供了实实在在的成本节约。
作者将Ornith-9B与其基础模型Qwen3.5-9B进行了对比,发现RL后训练提升了token效率和持续编码的一致性,但牺牲了单轮判断能力和对误导输入的鲁棒性,使得9B版本相较于35B版本升级幅度更窄。
在Claude Mythos轨迹上训练了一个9B模型(Qwythos 9B),在漏洞查找、SQL和函数调用方面取得了强劲成果,同时在A6000上使用llama.cpp本地运行。
Ornith-1.0-9B是一款新的90亿参数AI模型,针对8-12GB GPU进行了优化,在智能体编码基准测试中表现出色,性能与大小为其2-3倍的模型相当甚至超越。
Ai2和华盛顿大学发布论文Tmax,提出目前最强的开源终端智能体RL训练配方。仅用9B参数模型在Terminal-Bench 2.0上击败更大模型,关键在于低成本生成大量可验证训练数据,而非模型规模或算法。
发布了名为Qwopus3.5-9B-Coder的新型9B微调模型,该模型针对工具调用和智能体编码工作流进行了优化,在SWE-bench和HermesAgent-20测试中取得了出色成绩,同时可在经济实惠的硬件上运行。