难怪 Qwen 和 Gemma 差异这么大

Reddit r/LocalLLaMA 新闻

摘要

一位用户分享了一个观察:Qwen 和 Gemma 对代码的分词方式非常不同,对于相同的 HTML/JS 输入,Qwen 使用的 token 数量远少于 Gemma,这可能解释了它们在编程和语言任务上的表现差异。他们还提到了 LiquidAI 的一个可能使用更高效分词器重新训练模型的项目。

将相同的 HTML/JS 代码(330 行)粘贴到 Qwen 35B A3B 和 Gemma 26B A4B 中。Qwen:将输入分词为 1609 个 token;Gemma:将输入分词为 4258 个 token。天哪。我以前从未注意到这一点,也没见人提起过。仅这一点就有助于解释为什么 Qwen 被认为更擅长编程,而 Gemma 更擅长语言任务。Qwen 确实可以把代码看作某种特定的输入/输出形式,而 Gemma 则像处理常规语言一样将其拆分成单词片段。Qwen 在处理编程任务时还会展现出完全不同的推理风格。顺便说一句,对于指令文档(55 行),分词结果几乎相同:1025 对 1039 个 token。我见过某个项目,好像是 LiquidAI 的?用更高效的分词器重新训练现有模型。我很好奇这对 Gemma 这样的模型会有什么影响,是否有助于它迎头赶上。
查看原文

相似文章

通俗版对比:Qwen3.6 35b-a3b 与 Gemma4-26b-a4b-it

Reddit r/LocalLLaMA

Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd

Qwen3.6-35B 与 Gemma4-26B 在 7900 XTX 上的对比

Reddit r/LocalLLaMA

一项详细的基准测试对比了 Radeon 7900 XTX 上的 Qwen3.6-35B 和 Gemma4-26B,结果显示尽管 Gemma 的 token 生成速度较慢,但端到端快了约 20%,原因是 Qwen 因内部推理生成了约两倍的 token。文章建议:在吞吐量受限的批量任务中使用 Qwen,在延迟敏感的单次请求中使用 Gemma。