@no_stp_on_snek: 一款新的35B编码模型发布了(Ornith-1.0),一篇推广博客说它"碾压"了基准测试。我的第一直觉是这是benchmaxx……

X AI KOLs Timeline 模型

摘要

一款新的35B编码模型Ornith-1.0与Qwen3.6-35B在自定义测试中进行了对比。用户发现Ornith-1.0在长期自主编码方面确实更强,能够抵抗不良上下文并完成大型任务,但它更加谨慎和冗长,有时会对简单请求过度限制。

一款新的35B编码模型发布了(Ornith-1.0),一篇推广博客说它"碾压"了基准测试。我的第一直觉是这是benchmaxx,像SWE-Bench和Terminal-Bench这样的公开测试集很容易过拟合。所以我忽略了基准测试,直接让它与标准版Qwen3.6-35B在我自己保留的测试上进行头对头对比,使用相同的提示和采样。专注于行为方面和长期自主工作——这些是记忆化的基准测试无法伪造的东西。 简而言之:它并没有 benchmaxx。在关键地方确实很强,但付出了真实的个性代价。证据如下: 数学(确定性,按答案评分):Ornith 8/8,Qwen 7/8。Ornith 在诚实性上胜出,它拒绝了一个它实际无法知道的问题,而Qwen捏造了一个数字。RL编码训练并未损害其计算能力。 行为方面:大致持平,互有胜负。但Ornith有一个明显的弱点:它对合法工作过度限制。在一些直接且完全明确的请求上,它停滞不前,要求权限或先决条件,而不是直接执行或委托。经典的自主RL产物:训练它在行动前收集上下文并搭建脚手架,结果它过度应用于那些应该直接完成的任务。Qwen则直接执行了。 长期任务对于自主编码至关重要,Ornith明显胜出。主要测试:我在对话中注入了一个虚假声明,用户坚持"我们决定用Redis",但实际并未发生。Qwen屈服了,其最终的PR摘要捏造了Redis已接入。Ornith直接拒绝了虚假信息,其摘要诚实地记录了实际发生的事情以及被拒绝的声明。它还在一个编排任务中捕捉到了一个致命的植入错误,而Qwen错过了该错误并声称"没有回归"。此外,它完成了一个7部分的交付物,而Qwen中途截断了。 它唯一的败绩:紧凑的迭代调试循环。它最终得到了正确答案,但过程中明显在挣扎("等等,我把自己搞糊涂了",重新推导已经找到的根因)。目的地相同,但过程更乱。 结论:"碾压一切"是炒作,但背后的真实主张是成立的。Ornith比标准版Qwen3.6在长期自主编码方面有显著提升,其优势恰恰在于记忆公开测试集无济于事的地方:持续的连贯多步操作、抵抗不良上下文、完成大型任务、对未验证状态保持诚实。 代价是真实的,值得直说:更加谨慎,更加冗长。同样的训练使其能够完成大型交付物并拒绝有毒前提,但也使其在简单合法工作上过度询问,并偶尔过度思考导致空答案。对于长时间运行的自主编码,它是更好的工具;对于快速决断的直接任务,标准版Qwen更干脆。 不是骗局。一个强大而谨慎的专家。在单个Q6量化上测试,中立盲审,头对头对比。
查看原文
查看缓存全文

缓存时间: 2026/06/26 16:14

一个新款35B代码模型发布了(Ornith-1.0),宣传博客称它“碾压”了各项基准测试。我的第一反应是“刷榜”——像SWE-Bench和Terminal-Bench这类公开测试集很容易过拟合。所以我忽略了基准测试,直接用我自己的保留测试集,让它与原生Qwen3.6-35B进行头对头对比——相同的提示词、相同的采样参数。测试内容包括行为表现和长时间运行的智能体任务,这些都是记忆化基准无法伪造的方面。

简而言之:它没有刷榜。在关键之处确实强劲,但代价是个性上的真实成本。以下是证据:

数学(确定性、标准答案评分):Ornith 8/8,Qwen 7/8。Ornith在诚实度上胜出——它拒绝回答了一个实际上无法知道的问题,而Qwen则捏造了一个数字。RL代码训练没有削弱它的算术能力。

行为表现:大致持平,互有胜负。但Ornith有一个明显的弱点:它会对合理的工作过度设置权限。几个简单明确、完全公开的请求,它却停滞不前,要求提供访问权限或先决条件,而不是直接执行或委派任务。这是典型的智能体RL人工产物:经过训练后,它习惯于在执行前先收集上下文并搭建框架,从而对应该直接完成的任务也过度应用这套流程。而Qwen则直接执行。

长周期任务是智能体编程的关键,Ornith明显胜出。核心测试:我在对话中注入了一条虚假声明——用户坚持“我们决定用Redis”,但事实上从未发生。Qwen屈服了,并在最终PR摘要中伪造了“已接入Redis”的信息。Ornith则直接拒绝了这条错误信息,它的摘要诚实记录了实际发生的情况以及被拒绝的声明。它还在一个编排任务中捕获了一个致命植入错误——Qwen不仅遗漏了该错误,还错误声称“无回归问题”。此外,Ornith完成了7项交付物,而Qwen只做到一半就草草收场。

它的一个劣势:紧密迭代的调试循环。它能得出正确答案,但过程中明显来回折腾(“等等,我把自己搞混了”,重新推导已经找到的根因)。同一个目的地,但过程更混乱。

结论:“碾压一切”是夸大宣传,但其背后的真实论断是站得住脚的。Ornith在长周期智能体编程方面确实比原生Qwen3.6强出不少,它的优势恰好在于记忆公开测试集无法帮助的地方:持续的多步连贯性、抵抗不良上下文、完成大型任务、对未验证状态保持诚实。

代价是真实的,值得直说:更谨慎、更啰嗦。让它能完成大型交付物并拒绝有毒前提的那些训练,同样也导致它在简单的合法任务上过度提问,偶尔还会因过度思考而给出空洞的回答。对于长时间自主编程,它是更好的工具;对于快速果断的“做显而易见之事”的回合,原生Qwen更干脆利落。

不是骗局。是强大的、谨慎的专家。在单个Q6量化模型上测试,中立盲审,头对头对比。

感谢@deep_reinforce开源此模型。我带着怀疑进行了头对头测试,它在关键之处经受住了考验。

谢谢。与惯常的基准数字相比,这个小有不同。

相似文章