在CPU函数调用上对Needle 26M和Qwen3-0.6B进行基准测试,50个查询覆盖5个难度等级。体积小23倍的模型在准确率上胜出,速度也快4.4倍。

Reddit r/LocalLLaMA 工具

摘要

一项在CPU函数调用上比较Needle 26M和Qwen3-0.6B的基准测试显示,较小的Needle模型在准确率和速度上胜出,但失败模式截然不同:Needle选择错误的工具,而Qwen3则经常无法发出工具调用。

在4核CPU(无GPU,无刻意挑选)上对两个开放权重模型进行了工具调用的直接对比。想看看小的专用模型(Needle,26M,从Gemini 3.1蒸馏而来,专用于函数调用)是否真的能对抗同样支持工具的小型通用模型(Qwen3-0.6B)。设置:50个查询,分5个等级(简单、释义、隐式、模糊、边缘情况,包括外语和"不调用任何工具"陷阱)。5个模拟工具。每次运行三个指标:parse_success、tool_match、args_match。相同的查询、相同的评估规则、相同的硬件。主要数据:Needle (26M) Qwen3 (0.6B) tool_match整体 72.0% 56.0% parse_success 84.0% 54.0% args_match | 匹配 97.2% 100.0% 平均延迟 10.9秒 47.9秒。有趣的部分不是整体胜出,而是失败的方式。它们完全不同:* **Needle** 因选择错误工具而失败。当它选择了工具时,参数正确率高达97%。它的缺点是选择,主要是将系统命令路由到search_web而不是run_command。* **Qwen3** 因根本不调用工具而失败。其22次失误中每一次都是解析失败,它用散文回答而不是发出`<tool_call>`标签。当它确实发出调用时,参数100%完美。等级细分才是关键。T1和T2(字面和释义)各约95%持平。T3(隐式,如"我应该带伞去阿姆斯特丹吗?"其中工具名称从未出现)是Qwen3断崖式下跌的地方:80%降到10%。Needle只是映射意图。Qwen3试图用散文提供帮助,并为没有实时数据而道歉。T5(边缘)是Qwen3唯一胜出的等级,领先10分。印地语查询破坏了Needle的分词器(天城文片段严重,一个查询超时73秒,输出乱码)。Qwen3能干净地处理印地语和法语。几乎毁了Needle运行的一件事:第一次运行时它得分8%,因为我给了它OpenAI JSON Schema。Needle是在平面模式上训练的(`{location: {type, description, required}}`),它实际上将"properties"这个词作为参数值回显。写了一个转换器,准确率从8%跃升到72%,其他没有变化。如果有人使用Needle权重,值得知道。Qwen3有自己的问题,它在手工制作的提示模板上从未发出EOS,每次查询都用完256个token预算(约230秒)。切换到`tokenizer.apply_chat_template(tools=...)`加上`enable_thinking=False`将其降至约37秒,并且`<tool_call>`标签开始自然出现。我的看法:这些不是同一产品类别,尽管听起来像。Needle是一个调度器。Qwen3是一个也能调用工具的小型聊天机器人。如果你想在设备上进行固定调色板的单次工具路由,Needle对于13MB来说确实不错。如果你想要任何对话能力,Needle完全没有,Qwen3默认胜出。局限性:n=50很小。单CPU硬件。模拟工具,不是真实工具。希望任何人在不同硬件上或用释义压力测试复现并分享结果。包含完整代码、raw_log.jsonl、summary.json和5个图表的仓库在下面的评论中👇 此评估是使用NEO(AI工程代理)完成的。它构建了评估工具,处理了检查点运行,调试了模式不匹配和EOS问题,并汇总了结果。我手动检查了一切,并决定了发布什么。
查看原文

相似文章

RTX 3090 本地基准测试 - Qwen3.6 27b 对比 Ornith

Reddit r/LocalLLaMA

用户在RTX 3090上使用inspect-ai运行本地基准测试,比较Qwen3.6 27b、Gemma4 26B和Ornith1.0 35B。结果显示Qwen在知识和编码方面领先,而Ornith在接地性和召回方面具有竞争力。

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。