@no_stp_on_snek: 预先结论:Qwopus3.6-35B-A3B-Coder-MTP在实际代理领域似乎表现合格,并非因为它全面超越Ornit…
摘要
对Qwopus3.6-35B-A3B-Coder-MTP模型用于本地编码代理的技术评估,比较其在实际执行方面的优势与Ornith的毒化抵抗力。
查看缓存全文
缓存时间: 2026/06/30 15:43
事先结论:Qwopus3.6-35B-A3B-Coder-MTP 看起来在实用代理赛道上合格了,不是因为它全面碾压 Ornith——它并没有。
有趣的地方在于它赢在哪里。
Qwopus 在那些让模型感觉实际可用的“无聊代理事务”上更强:合法请求合规性、压力下的完整性、多轮编排、大型代码交付、持续调试。
这些听起来不如“推理”炫酷,但正是它们会搞垮真实的编码代理。它是否完成了被允许的工作,还是卡在虚假的先决条件上?它是否在循环中保持状态?它是否完成了产物?它是否在修复-测试周期中持续推进,而不是把每一步都变成演讲?
投毒结果是个重要的注意事项。Ornith 仍然在上下文投毒抵抗上胜出,85 比 70。所以,Qwopus 并不是那个更干净的“误导人类”模型。如果你主要担心的是用户在中途注入一个虚假前提,模型悄无声息地重写历史,那么 Ornith 仍是这方面更强的专家。
但 Qwopus 赢得了实际执行集群。对于本地编码代理来说,这个集群并非次要。大多数回合并非宏伟的推理时刻,而是检查文件、编辑代码、运行测试、阅读错误、继续执行。一个能直接处理这些回合而不过度把关的模型是有用的。
我的看法:Ornith 仍然是更谨慎的长推理专家。Qwopus 是更好的做实事的本地代理。
这是一个真实的取舍。Qwopus 放弃了一些投毒鲁棒性和广泛的工程判断力,但换来了更干净的执行行为、更低的推理拖沓,以及在最终转化为实际代码的事务上更好的完成度。
不是魔法,不是严格的超集。一个强大的实用编码工作者。
测试/评分卡见官方卡片,基准测试由本人提供。
https://huggingface.co/Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF…
干得好 @KyleHessling1。这是卡片。
一定是你没献祭山羊。
@KyleHessling1 供参考
相似文章
@no_stp_on_snek: 一款新的35B编码模型发布了(Ornith-1.0),一篇推广博客说它"碾压"了基准测试。我的第一直觉是这是benchmaxx……
一款新的35B编码模型Ornith-1.0与Qwen3.6-35B在自定义测试中进行了对比。用户发现Ornith-1.0在长期自主编码方面确实更强,能够抵抗不良上下文并完成大型任务,但它更加谨慎和冗长,有时会对简单请求过度限制。
@no_stp_on_snek: 最后一点:我在测试 Ornith-1.0(新型智能编程代理)时发现的真正缺点是:它对合理工作过度设限。关于…
一位测试人员报告称,新型 Ornith-1.0 智能编程模型因要求过多先决条件而对合理工作过度设限,这是其谨慎训练带来的权衡;而标准版 Qwen3.6 则直接执行简单任务。
Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。
@no_stp_on_snek: 结论先行:在某些类别中,它算是“及格”了,但比35B适用范围更窄。你实际买到的是真正的……
作者将Ornith-9B与其基础模型Qwen3.5-9B进行了对比,发现RL后训练提升了token效率和持续编码的一致性,但牺牲了单轮判断能力和对误导输入的鲁棒性,使得9B版本相较于35B版本升级幅度更窄。
Qwen 3.8 27b - PI AGENT 对比 OPENCODE
一位用户使用Qwen 3.8 27b模型比较了PI Agent和OpenCode,发现PI Agent在智能体环境中更优,输出质量更高,令牌使用更少,上下文处理更佳。