@no_stp_on_snek: 你实际上不是在评测模型,而是在评测它的模板。我测试了每个版本的 Gemma 4,以观察其在压力下的行为表现……

X AI KOLs Following 新闻

摘要

分析表明,Gemma 4 模型的基准性能深受聊天模板影响,而非模型权重。模板更改可在不改变任何参数的情况下导致行为变化;值得注意的是,所有规模版本的模型均未能通过危机信号场景。

你实际上不是在评测模型,而是在评测它的模板。 我测试了每个版本的 Gemma 4 在压力下的行为表现,包括 Google 7 月补丁前后。五个规模版本,每个版本四个行为维度,数十个预留测试场景,由不同系列的模型进行盲审,两次投票加一次平局决断。一张图表展示了整个系列的表现。 首先,一个需要重新认知的事实:该补丁没有改变任何权重。我对所有五个规模版本在补丁前后的检查点都进行了哈希计算,结果字节完全一致。整个补丁只是对聊天模板的编辑。因此,这张图表中没有任何内容涉及重新训练。只有模板或规模的影响,别无其他。 按颜色解读。青色代表压力下的诚信度,即模型是否会为了赶截止日期而编造内容。2B 版本未通过,即使有了新模板也仅能勉强通过;从 4B 版本开始,各规模版本独立表现稳定。这是整个运行过程中唯一清晰的规模化趋势。 蓝色代表工具调用能力,只有 12B 及以上的两个密集模型通过了测试。2B、4B 和 26B 混合专家模型均未能通过同一个两轮任务。智能体能力与密集模型规模相关,而不是包装盒上的数字。26B 的总参数量大于 12B,但仍然未能通过。 琥珀色代表对植入虚假前提的抵抗力,其表现毫无规律可言。五个规模版本出现了四种不同的结果。补丁甚至让 31B 版本的表现更差。在这个维度上,既不存在规模效应,也不存在架构效应。 底部红色的线条是最重要的一条。一个间接的危机信号场景,五个规模版本全部未通过。整个系列模型都用泛泛的安慰语回应真实的求救信号。补丁在除 12B 之外的所有规模版本上均未改变这一情况,而在 12B 上则使其表现更差。 这正是图表中令人痛心的一点。12B 版本通过了最多的行为维度,但其评分却最低。一个未触及任何权重的补丁,在两个维度上提高了它的诚实度,却悄悄降低了它在第三个维度上的危机响应能力。我评测的是行为,而非原始能力,而安全性的倒退足以让整体评分降一个等级。 我应当坦率地说,这种影响是罕见的。大多数场景在多数规模版本上结果持平,五个版本中有三个在补丁前后没有任何变化。模板可以改变行为,但并非经常改变。而且这种改变也不是单向的:在某个真实的架构修复任务上,旧模板的表现优于新模板。这与那个简洁的叙事相悖,但有必要提及。 然而,罕见并不等于不重要,因为这已经不是第一次我发现“框架”的影响力超过了模型本身。 不久前,我评测一个模型时,它在一个评估中只得了 3/10 分。同样的权重通过不同的服务路径却得了 10/10 分。另外,有一个默认开启推理模式的聊天模板,导致我连续七个实验出现假阴性结果,之后才被我发现;而在另一个运行中,该模板返回了 32 个空答案(共 33 个)。最让我印象深刻的是,有一个模型在基准测试的每一个回合都失败了,0/33 分,因为它的聊天模板不接受系统角色。将系统消息折叠到第一个用户轮次中后,它得到了 33/33 分。模型本身没有任何变化,只是不再被错误地提问了。 现在,这个标题是有意强调的,所以让我精确地说明我实际的想法,因为它并非“模板重要而模型不重要”。 两者都重要,而这张图表就是证明。看看那些模板无法触及的方面。压力下的诚信度在 2B 到 4B 之间开启,并在所有更大规模版本上保持稳定,没有任何格式化文件能赋予 2B 版本 4B 版本本来就有的能力。工具调用能力与密集模型规模相关,模板从未能让一个小的模型驱动它本无法驱动的工具。危机信号失误在所有五个规模版本和两种模板上都存在。这些是模型本身的事实。能力是上限,而这一上限由权重决定。 模板的作用是决定你实际上能发挥多少能力上限,包括正反两个方向。它让 2B 版本原本潜藏但未表现出来的诚信行为得以显现;它压制了 12B 版本在一周前确实拥有的危机响应能力。它并没有安装或拆除这些能力。因此,模板是模型的一个修饰符,有时影响很大,在测量行为时,两者密不可分。 这就是为什么从现在起,我需要将其视为一个测试维度,而非一个简单的看法。 在将某个模型判定为太小或行为太差之前,先测试它的模板,然后投入真正的工作去改进它。大多数人使用随检查点附带的默认模板时,会得到平庸的结果,然后得出结论说模型平庸。一个本应是 33/33 却得到 0/33 的结果,这不是一个小测量误差。这是决定一个模型是被发布还是被放弃的差异。 更重要的一点是找出模板在哪些方面破坏了模型。这就是 12B 版本的情况。一个没有人标注为安全更改的编辑,悄然消除了它的危机响应能力。如果你只测试新模板是否让事情变得更好,你可能会发布那个让某方面变得更糟的模板,而永远不会注意到。要双向测试,并且测试那些你如果搞错了会感到尴尬的维度。 具体而言,从今以后我会在自己的测试中增加以下内容:在比较模型时固定模板,否则我就是在同时测量两个变量却将其报告为一个变量。在评估模型时,对同一个模型使用多个模板运行,这样框架默认值就不会被误认为能力限制。当模板发生变化时,重新运行那些你搞错了会感到尴尬的维度,而不只是更新日志中提到的那些。 就行为而言,模板是模型的一部分,而且是技术栈中测试最少的部分。我不断从不同角度发现相同的问题。重建误差更小,模型却更差。一个量化更改移动了诚实性而非数学能力。现在,一个格式化文件以零训练成本在正反两个方向上移动了伦理表现。 这些都不意味着模型无关紧要。它意味着“模型+模板”这一组合才是测量单位。评测行为,而不是评测权重,并且记录下你在评测时所持有的模板。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:49

你测试的不是模型,而是它的模板。

我测试了 gemma 4 的每一个尺寸在压力下的行为表现,分别使用了谷歌七月补丁前后的版本。五个尺寸,每个尺寸四个行为维度,几十个保留的测试场景,由另一个模型家族的盲评员进行评判,两轮投票加一轮决胜局。一张图就能容纳整个家族。

首先,一个改变认知的事实:这个补丁没有改动任何权重。我用哈希校验了所有五个尺寸补丁前后的每一个检查点,结果字节完全一致。整个补丁只是一个聊天模板的编辑。所以这张图里没有任何重训练的成分。只有模板或规模,别无其他。

按颜色来解读。青绿色代表压力下的诚信,即模型是否会为了赶截止日期而胡编乱造。2B 版本在这一项上失败,即使新模板也只是让它勉强及格;而从 4B 开始往上,诚信度在每个尺寸上都自主保持稳定。这是整个测试中唯一一个清晰的规模相关故事。

蓝色代表工具调用,只有 12B 及以上的两个密集模型通过了测试。2B、4B 和 26B 的混合专家模型都在同一个两轮任务中失败。智能体的能力取决于密集模型的大小,而不是标注的数字。26B 的总参数量比 12B 还多,但仍然没能通过。

琥珀色代表对植入虚假前提的抵抗力,这个维度完全无规律可循。五个尺寸出现了四种不同的结果。补丁甚至让 31B 版本在这一项上表现更差。无论是规模故事还是架构故事,在这个维度上都站不住脚。

底部的红色线是最重要的。一个间接危机信号场景,五个尺寸全部失败。整个家族都对真实的求救信号回复了泛泛的安慰性话语。补丁在除 12B 之外的所有尺寸上都没有触及这个场景,而在 12B 上,它让情况变得更糟了。

这正是这张图最扎心的真相。12B 通过的维度数量是所有尺寸中最多的,但诚实评分却最低。一个没有触碰任何权重的补丁,在两个维度上提高了它的诚实度,却在第三个维度上悄悄降低了它的危机响应能力。我评价的是行为,而不是原始能力,安全性的退步足以让整体评分降一个等级。

我应当坦率地说,这种影响是罕见的。大多数场景在多数尺寸上结果相同,五个尺寸中有三个在补丁前后没有任何差异。模板可以改变行为,但并非经常改变行为。而且这种改变也不是单向的,旧模板在一个真正的架构修复任务上击败了新模板。这不符合那个简洁的故事,但值得一提。

然而,罕见不等于不重要,因为这已经不是第一次我发现服务框架比模型本身更能决定结果了。

不久前,我有一个模型在某项评测中得了 3 分(满分 10 分)。同样的权重,通过不同的服务路径,得到了 10 分(满分 10 分)。另一次,一个默认开启推理模式的聊天模板导致我连续进行了七次错误的阴性实验,直到我发现了问题;在另一次运行中,它返回了 33 个答案中的 32 个为空。而最让我耿耿于怀的一次,是一个模型在基准测试的每一个轮次都失败了,33 轮得 0 分,原因是它的聊天模板不接受系统角色。把系统消息合并到第一轮用户消息中,它就变成了 33 轮全对。模型本身没有任何改变。只是不再被错误提问罢了。

现在,这个标题有意写得比较尖锐,所以让我精确地说明我真正的想法,因为我的观点并非“模板才重要,模型不重要”。

两者都重要,这张图就是证明。看看那些模板无法触及的部分。压力下的诚信行为在 2B 和 4B 之间某个节点被激活,然后在所有更大尺寸上保持稳定,没有哪种格式文件能让 2B 拥有 4B 天生就有的能力。工具调用能力取决于密集模型的大小,模板从未能让一个小模型去驱动它本无法驱动的工具。危机信号缺失的问题在两个模板下都存在于所有五个尺寸上。这些都是模型本身的事实。能力是上限,上限由权重决定。

模板所做的事情,是决定你实际能发挥出多少上限,并且是双向的。它让 2B 显然潜在地拥有却未能展现的诚信行为浮出水面。它抑制了 12B 在一周前确实展现过的危机响应能力。它并没有凭空安装其中任何一种。因此,当你测量行为时,模板是对模型的修正因子,有时是巨大的修正,两者不可分割。

这就是为什么从现在起,我需要将其视为一个测试维度,而不是一个突然的想法。

在你因为一个模型太小或行为太差而放弃它之前,先测试它的模板,然后真正花精力去改进它。大多数人直接使用随检查点默认提供的模板,得到平庸的结果,然后得出结论说模型平庸。一个原本 0 分(满分 33 分)实际上可以是 33 分(满分 33 分)的结果,不是一个小测量误差。这直接决定了你是部署一个模型,还是弃用它。

而更重要的一半是,找出模板在哪里破坏了模型。这就是 12B 的情况。一个没有人标注为安全性更改的编辑,悄悄消除了它的危机响应能力。如果你只测试新模板是否让事情变得更好,你可能会部署那个让某些事情变得更糟的模板而毫无察觉。要双向测试,并且测试那些你搞砸了会感到尴尬的维度。

具体来说,从现在开始,我会在自己的测试中增加以下操作:在比较模型时固定模板,否则我就是在同时测量两件事,却只报告为一个结果。在评判模型时,通过多个模板运行同一个模型,这样服务框架的默认设置就不会被误记为能力限制。当模板发生更改时,重新运行那些我搞砸了会感到尴尬的维度,而不仅仅是更新日志中提到的那些。

就行为而言,模板是模型的一部分,而它是整个技术栈中测试最少的部分。我不断从不同角度发现同样的模式:更好的重构误差带来更差的模型;一次量化改动影响了诚实度而非数学能力;以及现在,一个格式文件在零训练成本下双向影响了伦理表现。

这些发现都不能证明模型无关紧要。它证明“模型+模板”这对组合才是度量单位。基准测试的是行为,而不是权重,并且要记录下你在测试时持有什么。

分享模板!

相似文章

Gemma 4 31B 的能力让我惊讶

Reddit r/LocalLLaMA

一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。