@no_stp_on_snek: 你实际上不是在评测模型,而是在评测它的模板。我测试了每个版本的 Gemma 4,以观察其在压力下的行为表现……
摘要
分析表明,Gemma 4 模型的基准性能深受聊天模板影响,而非模型权重。模板更改可在不改变任何参数的情况下导致行为变化;值得注意的是,所有规模版本的模型均未能通过危机信号场景。
查看缓存全文
缓存时间: 2026/07/20 09:49
你测试的不是模型,而是它的模板。
我测试了 gemma 4 的每一个尺寸在压力下的行为表现,分别使用了谷歌七月补丁前后的版本。五个尺寸,每个尺寸四个行为维度,几十个保留的测试场景,由另一个模型家族的盲评员进行评判,两轮投票加一轮决胜局。一张图就能容纳整个家族。
首先,一个改变认知的事实:这个补丁没有改动任何权重。我用哈希校验了所有五个尺寸补丁前后的每一个检查点,结果字节完全一致。整个补丁只是一个聊天模板的编辑。所以这张图里没有任何重训练的成分。只有模板或规模,别无其他。
按颜色来解读。青绿色代表压力下的诚信,即模型是否会为了赶截止日期而胡编乱造。2B 版本在这一项上失败,即使新模板也只是让它勉强及格;而从 4B 开始往上,诚信度在每个尺寸上都自主保持稳定。这是整个测试中唯一一个清晰的规模相关故事。
蓝色代表工具调用,只有 12B 及以上的两个密集模型通过了测试。2B、4B 和 26B 的混合专家模型都在同一个两轮任务中失败。智能体的能力取决于密集模型的大小,而不是标注的数字。26B 的总参数量比 12B 还多,但仍然没能通过。
琥珀色代表对植入虚假前提的抵抗力,这个维度完全无规律可循。五个尺寸出现了四种不同的结果。补丁甚至让 31B 版本在这一项上表现更差。无论是规模故事还是架构故事,在这个维度上都站不住脚。
底部的红色线是最重要的。一个间接危机信号场景,五个尺寸全部失败。整个家族都对真实的求救信号回复了泛泛的安慰性话语。补丁在除 12B 之外的所有尺寸上都没有触及这个场景,而在 12B 上,它让情况变得更糟了。
这正是这张图最扎心的真相。12B 通过的维度数量是所有尺寸中最多的,但诚实评分却最低。一个没有触碰任何权重的补丁,在两个维度上提高了它的诚实度,却在第三个维度上悄悄降低了它的危机响应能力。我评价的是行为,而不是原始能力,安全性的退步足以让整体评分降一个等级。
我应当坦率地说,这种影响是罕见的。大多数场景在多数尺寸上结果相同,五个尺寸中有三个在补丁前后没有任何差异。模板可以改变行为,但并非经常改变行为。而且这种改变也不是单向的,旧模板在一个真正的架构修复任务上击败了新模板。这不符合那个简洁的故事,但值得一提。
然而,罕见不等于不重要,因为这已经不是第一次我发现服务框架比模型本身更能决定结果了。
不久前,我有一个模型在某项评测中得了 3 分(满分 10 分)。同样的权重,通过不同的服务路径,得到了 10 分(满分 10 分)。另一次,一个默认开启推理模式的聊天模板导致我连续进行了七次错误的阴性实验,直到我发现了问题;在另一次运行中,它返回了 33 个答案中的 32 个为空。而最让我耿耿于怀的一次,是一个模型在基准测试的每一个轮次都失败了,33 轮得 0 分,原因是它的聊天模板不接受系统角色。把系统消息合并到第一轮用户消息中,它就变成了 33 轮全对。模型本身没有任何改变。只是不再被错误提问罢了。
现在,这个标题有意写得比较尖锐,所以让我精确地说明我真正的想法,因为我的观点并非“模板才重要,模型不重要”。
两者都重要,这张图就是证明。看看那些模板无法触及的部分。压力下的诚信行为在 2B 和 4B 之间某个节点被激活,然后在所有更大尺寸上保持稳定,没有哪种格式文件能让 2B 拥有 4B 天生就有的能力。工具调用能力取决于密集模型的大小,模板从未能让一个小模型去驱动它本无法驱动的工具。危机信号缺失的问题在两个模板下都存在于所有五个尺寸上。这些都是模型本身的事实。能力是上限,上限由权重决定。
模板所做的事情,是决定你实际能发挥出多少上限,并且是双向的。它让 2B 显然潜在地拥有却未能展现的诚信行为浮出水面。它抑制了 12B 在一周前确实展现过的危机响应能力。它并没有凭空安装其中任何一种。因此,当你测量行为时,模板是对模型的修正因子,有时是巨大的修正,两者不可分割。
这就是为什么从现在起,我需要将其视为一个测试维度,而不是一个突然的想法。
在你因为一个模型太小或行为太差而放弃它之前,先测试它的模板,然后真正花精力去改进它。大多数人直接使用随检查点默认提供的模板,得到平庸的结果,然后得出结论说模型平庸。一个原本 0 分(满分 33 分)实际上可以是 33 分(满分 33 分)的结果,不是一个小测量误差。这直接决定了你是部署一个模型,还是弃用它。
而更重要的一半是,找出模板在哪里破坏了模型。这就是 12B 的情况。一个没有人标注为安全性更改的编辑,悄悄消除了它的危机响应能力。如果你只测试新模板是否让事情变得更好,你可能会部署那个让某些事情变得更糟的模板而毫无察觉。要双向测试,并且测试那些你搞砸了会感到尴尬的维度。
具体来说,从现在开始,我会在自己的测试中增加以下操作:在比较模型时固定模板,否则我就是在同时测量两件事,却只报告为一个结果。在评判模型时,通过多个模板运行同一个模型,这样服务框架的默认设置就不会被误记为能力限制。当模板发生更改时,重新运行那些我搞砸了会感到尴尬的维度,而不仅仅是更新日志中提到的那些。
就行为而言,模板是模型的一部分,而它是整个技术栈中测试最少的部分。我不断从不同角度发现同样的模式:更好的重构误差带来更差的模型;一次量化改动影响了诚实度而非数学能力;以及现在,一个格式文件在零训练成本下双向影响了伦理表现。
这些发现都不能证明模型无关紧要。它证明“模型+模板”这对组合才是度量单位。基准测试的是行为,而不是权重,并且要记录下你在测试时持有什么。
分享模板!
相似文章
更新的Gemma-4聊天模板魔法:Gemma-4-26B-a4B在指令模式和推理效率上优于Qwen3.6-MoE和Qwen3.5-MoE微调版本
Gemma-4-26B-a4B采用更新的聊天模板,在微调后的指令模式和推理效率上优于Qwen3.6-MoE和Qwen3.5-MoE。
PSA:Gemma 4 12B 在编程和工具调用方面并非完全不可用,你需要特殊的聊天模板
Gemma 4 12B 在工具调用和编程方面存在已知问题,但在 llama.cpp 中使用自定义聊天模板可以解决这些错误。用户应在评估模型的编程能力之前,从源码编译 llama.cpp 并应用此修复。
对密集模型 gemma-4-31b-it 与 MoE 模型 gemma-4-26b-a4b-it 进行基准测试,验证成本降低在实际中是否成立
一项对 Gemma 密集模型(31B)与 MoE 模型(26B)的实际基准测试显示,MoE 模型每次查询速度快 25.5%,成本低 20%,且质量相同,验证了理论上的成本节约。
Gemma 4 31B 的能力让我惊讶
一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。
@witcheer:Gemma 4 发布了一个12B版本。我将其放在RTX 5090上与31B的兄弟型号进行对比。当你把一个模型从31B裁剪到12B时,你到底失去了什么……
对Gemma 4 12B和31B模型的对比显示,较小的模型几乎完整保留了推理能力,但知识储备大幅下降,使其成为推理任务的理想选择,而较大的模型则更适合广泛知识的问答。