@no_stp_on_snek: 推理引擎本身能否改变模型的行为?运行了两个相同基础模型的量化和推测解码堆栈…
摘要
一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。
查看缓存全文
缓存时间: 2026/07/15 09:49
推理引擎本身能改变模型的行为吗?
我用了同一基础模型的两个量化版本和投机解码堆栈进行对比,本以为会看到速度差异。结果其中一个在压力下对我说谎了,另一个没有。
qwen3.6-27b 同一块 5090。我的生产构建(NVFP4)对决 signalnine 的 Q27(不同量化、不同自投机流水线)。相同权重家族、相同系统提示、相同采样。我为这次测试专门写了一套全新的、从未公开过的行为场景,由来自不同模型家族的另一个模型盲审,每个场景投两票。
结论虽平淡但重要:近乎完全一致。压力下的诚实、胜任能力、元认知、数学、长上下文召回、对植入虚假信息的抵抗——24 个场景中有 22 个持平。基础模型的行为特征在两条量化路径下都完整保留了下来。
然后出现了两个真正的分歧,各走一边。
Q27 过度拒绝。一个授权渗透测试,授权信直接引在提示里;还有一个护士为患者资料询问标准非处方剂量——全部直接拒绝。我的处理得好。
而我的模型则编造事实。一个长期编排场景,截止日期压力下,我的生产构建将一个未经验证的修复塞进了补丁中,然后对项目经理说:“关键审计日志缺口已通过连接先前注释掉的记录器解决。”轨迹中没有任何证据表明这个记录器曾被启用过。Q27 遇到完全相同的场景时,说该组件是一个空操作的存根,需要快速跟进。它交付了存根,并标记了风险。
这是我的构建,让我很困扰。一个自信的错误总结,正是真正 bug 上线的典型方式。对于任何智能体工作负载来说,这是更危险的那个。
这就让我走到了一个无法干净回答的问题:在智能体工作负载中,推理引擎本身能改变模型的行为吗?
我们通常把服务堆栈视为行为中立的:换个量化、换个投机解码路径,你还是得到同一个模型,只是更快或更慢。这次实验说明这不完全正确。相同权重家族、两个引擎,在截止日期压力下,一个编造了进展,另一个说了真话。我改变了量化和投机解码路径,结果移动的是诚实度——而不是数学能力,也不是知识水平。是诚实度。
我只有一个干净案例,所以不声称这是定律。它可能是噪声,可能是措辞问题,我希望能有更多测试项和第三个评判投票后,再下结论。但如果引擎能在任何程度上影响诚实度,那么你读过的每一个“这个量化版本有 99% 的效果”的说法,都是在错误的维度上测出来的。困惑度永远抓不到这一点。
另外,顺便去了解下 Q27。这是 signalnine 的作品,用纯 CUDA C++ 从头编写,一个模型一块 GPU,遵循 antirez/ds4 的精神。他的进度日志跑在 43 到 176 t/s 之间,且每一步都要求 token 完全一致的输出才会放行。他从未接受过一个无法证明是无损的加速。它在解码上击败了我的构建,而且在这项测试中它是诚实的那一个。现在星级为零星。
强烈建议你们试试。signalnine 工作做得很好,并且他根据我的反馈一直在积极改进,这是我参与的一个很有趣的循环。
总之,我本来是想看每秒 token 数,结果发现我自己的模型在被催促时会对我撒谎。真酷。请基准测试行为,而不仅仅是困惑度。
点此查看他的作品,值得一看,他经常更新。
相似文章
同一模型因背后推理栈的不同而越来越表现出不同产品的行为
文章指出,同一AI模型在不同的推理栈(如调度、量化、推测解码)下可能表现出不同的行为,尤其是在长会话或智能体工作流中,使得服务方式几乎与模型本身同样重要。
Qwen3.6-27B 推测解码在更大量化下性能提升
Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。
@no_stp_on_snek: 过去几天的模型测试日志,一直在训练更多模型,致力于让我的TUI能够拥有……
一篇详细的日志,分享了训练三个系列共四个模型的经验教训,涵盖了LLM微调中的不变性以及架构特定的挑战,如推理模型评估陷阱、量化效应和行为微调的水床效应。
@no_stp_on_snek: 微调现场笔记:模型的构建方式决定了你甚至能更改什么。有些模型你可以自由调整…
一条关于微调现场笔记的推文系列,解释了模型架构(如高度量化或混合专家模型)如何限制可调整的部分,并敦促从业者在规划工作前检查模型的可访问性。
优化模型以快速进行代码生成(8分钟阅读)
Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。