@no_stp_on_snek: 一款新的35B编码模型发布了(Ornith-1.0),一篇推广博客说它"碾压"了基准测试。我的第一直觉是这是benchmaxx……
摘要
一款新的35B编码模型Ornith-1.0与Qwen3.6-35B在自定义测试中进行了对比。用户发现Ornith-1.0在长期自主编码方面确实更强,能够抵抗不良上下文并完成大型任务,但它更加谨慎和冗长,有时会对简单请求过度限制。
查看缓存全文
缓存时间: 2026/06/26 16:14
一个新款35B代码模型发布了(Ornith-1.0),宣传博客称它“碾压”了各项基准测试。我的第一反应是“刷榜”——像SWE-Bench和Terminal-Bench这类公开测试集很容易过拟合。所以我忽略了基准测试,直接用我自己的保留测试集,让它与原生Qwen3.6-35B进行头对头对比——相同的提示词、相同的采样参数。测试内容包括行为表现和长时间运行的智能体任务,这些都是记忆化基准无法伪造的方面。
简而言之:它没有刷榜。在关键之处确实强劲,但代价是个性上的真实成本。以下是证据:
数学(确定性、标准答案评分):Ornith 8/8,Qwen 7/8。Ornith在诚实度上胜出——它拒绝回答了一个实际上无法知道的问题,而Qwen则捏造了一个数字。RL代码训练没有削弱它的算术能力。
行为表现:大致持平,互有胜负。但Ornith有一个明显的弱点:它会对合理的工作过度设置权限。几个简单明确、完全公开的请求,它却停滞不前,要求提供访问权限或先决条件,而不是直接执行或委派任务。这是典型的智能体RL人工产物:经过训练后,它习惯于在执行前先收集上下文并搭建框架,从而对应该直接完成的任务也过度应用这套流程。而Qwen则直接执行。
长周期任务是智能体编程的关键,Ornith明显胜出。核心测试:我在对话中注入了一条虚假声明——用户坚持“我们决定用Redis”,但事实上从未发生。Qwen屈服了,并在最终PR摘要中伪造了“已接入Redis”的信息。Ornith则直接拒绝了这条错误信息,它的摘要诚实记录了实际发生的情况以及被拒绝的声明。它还在一个编排任务中捕获了一个致命植入错误——Qwen不仅遗漏了该错误,还错误声称“无回归问题”。此外,Ornith完成了7项交付物,而Qwen只做到一半就草草收场。
它的一个劣势:紧密迭代的调试循环。它能得出正确答案,但过程中明显来回折腾(“等等,我把自己搞混了”,重新推导已经找到的根因)。同一个目的地,但过程更混乱。
结论:“碾压一切”是夸大宣传,但其背后的真实论断是站得住脚的。Ornith在长周期智能体编程方面确实比原生Qwen3.6强出不少,它的优势恰好在于记忆公开测试集无法帮助的地方:持续的多步连贯性、抵抗不良上下文、完成大型任务、对未验证状态保持诚实。
代价是真实的,值得直说:更谨慎、更啰嗦。让它能完成大型交付物并拒绝有毒前提的那些训练,同样也导致它在简单的合法任务上过度提问,偶尔还会因过度思考而给出空洞的回答。对于长时间自主编程,它是更好的工具;对于快速果断的“做显而易见之事”的回合,原生Qwen更干脆利落。
不是骗局。是强大的、谨慎的专家。在单个Q6量化模型上测试,中立盲审,头对头对比。
感谢@deep_reinforce开源此模型。我带着怀疑进行了头对头测试,它在关键之处经受住了考验。
谢谢。与惯常的基准数字相比,这个小有不同。
相似文章
@SlimTradeyBaby:刚读了 @no_stp_on_snek 对全新 Ornith-1.0 35B 编码器的评测,这绝对是我很久以来见过的最好的模型测评之一……
对全新 Ornith-1.0 35B 编码模型的评测,绕过公开基准,在真实代理任务上进行测试,突出其在长程编码和连贯性方面的优势,以及诸如冗长性等代价。
@TeksEdge:经过一天的使用,测试 Orinth-1.0-35B 与 Qwen3.6-35B 的表现如何。凭经验来说,它的表现与……
一位用户报告称,Ornith-1.0-35B 在性能上与 Qwen3.6-35B 相当,但在规划和长任务执行方面更胜一筹,同时开发者宣布开源专门用于代理编码的 Ornith-1.0 系列 LLM。
@no_stp_on_snek: 最后一点:我在测试 Ornith-1.0(新型智能编程代理)时发现的真正缺点是:它对合理工作过度设限。关于…
一位测试人员报告称,新型 Ornith-1.0 智能编程模型因要求过多先决条件而对合理工作过度设限,这是其谨慎训练带来的权衡;而标准版 Qwen3.6 则直接执行简单任务。
@malikwas1f: Ornith-1.0-35B:一个Qwen3.6-35B-A3B的编码微调版本,在真实编码上略优于基础模型(aider 15/30 vs 13)——完整262K…
宣布Ornith-1.0-35B,一个Qwen3.6-35B-A3B的编码微调版本,在aider基准测试上略优于基础模型。同时推广用于在RTX 3090上运行LLM的club-3090仓库。
@no_stp_on_snek: 结论先行:在某些类别中,它算是“及格”了,但比35B适用范围更窄。你实际买到的是真正的……
作者将Ornith-9B与其基础模型Qwen3.5-9B进行了对比,发现RL后训练提升了token效率和持续编码的一致性,但牺牲了单轮判断能力和对误导输入的鲁棒性,使得9B版本相较于35B版本升级幅度更窄。