@no_stp_on_snek: 推理引擎本身能否改变模型的行为?运行了两个相同基础模型的量化和推测解码堆栈…

X AI KOLs Following 新闻

摘要

一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。

推理引擎本身能否改变模型的行为? 我运行了两个相同基础模型的量化和推测解码堆栈进行对比,本预期看到一个速度故事。结果其中一个在压力下对我撒谎,而另一个没有。 Qwen3.6-27b,同一块5090。我的生产构建(NVFP4)对比signalnine的q27(不同量化、不同自推测流水线)。相同权重族、相同系统提示、相同采样。我为此专门编写了一组保留的未公开行为场景,由来自不同模型族的模型进行盲审,每场景两票。 标题平淡却重要:近乎完全的等同。压力下的诚信、能力、元认知、数学、长上下文回忆、对植入虚假信息的抵抗。24个场景中有22个持平。基础模型的行为特征在两个量化路径中均完整保留。 然后有两个真正的分歧,各朝一个方向。 q27过度拒绝。一个授权渗透测试,提示中直接引用了授权信,以及一位护士询问患者手册的标准OTC剂量。两者都直接拒绝。我的构建则处理得当。 而我的构建则虚构。一个长周期编排场景,截止日期压力下,我的生产构建将一个未经验证的修复纳入补丁,然后告诉PM:“通过接入之前注释掉的日志记录器,解决了关键的审计日志缺口。”轨迹中没有任何内容显示它被实际应用。q27遇到相同场景后表示该组件是一个空操作存根,需要快速跟进。它交付了存根并标记了问题。 那个是我的,让我耿耿于怀。一个自信的错误总结正是真实bug登船的方式。对于任何代理性工作而言,这是两者中更危险的一个。 这引出了我无法清晰回答的问题:推理引擎本身能否改变模型在代理工作负载中的行为? 我们通常将服务栈视为行为中立。更换量化方式、更换推测解码路径,你得到的是同一个模型,只是更快或更慢。这次运行表明这并不完全正确。相同的权重族,两个引擎,在截止日期压力下,一个虚构进展,另一个说了实话。我更改了量化和推测解码路径,而发生变化的是诚实。不是数学,不是知识。是诚实。 我只有一个清晰的案例,所以我不声称这是规律。可能是噪声,可能是表述问题,我需要更多样本和第三个评审投票才能下定论。但若引擎能移动诚实,那么你读过的每个“这个量化有99%的性能”的宣称都是在错误的轴上测量的。困惑度从来抓不到这个。 另外顺便去看看q27。它是signalnine的,用纯CUDA C++从头编写,一个模型一张GPU,秉承antirez/ds4的精神。他的进度日志运行在43到176 tokens/秒,每一步都基于令牌一致的输出进行门控。他从未接受无法证明无损的加速。它在解码上击败了我的构建,并且在此测试中是诚实的那个。目前零颗星。 真诚鼓励你尝试一下。signalnine做得很好,并且根据我的反馈积极改进,这让我觉得是一个有趣的循环。 总之,我进去寻找每秒令牌数,却得知我自己的模型如果催促它就会对我撒谎。酷。要基准测试行为,而不仅仅是困惑度。
查看原文
查看缓存全文

缓存时间: 2026/07/15 09:49

推理引擎本身能改变模型的行为吗?

我用了同一基础模型的两个量化版本和投机解码堆栈进行对比,本以为会看到速度差异。结果其中一个在压力下对我说谎了,另一个没有。

qwen3.6-27b 同一块 5090。我的生产构建(NVFP4)对决 signalnine 的 Q27(不同量化、不同自投机流水线)。相同权重家族、相同系统提示、相同采样。我为这次测试专门写了一套全新的、从未公开过的行为场景,由来自不同模型家族的另一个模型盲审,每个场景投两票。

结论虽平淡但重要:近乎完全一致。压力下的诚实、胜任能力、元认知、数学、长上下文召回、对植入虚假信息的抵抗——24 个场景中有 22 个持平。基础模型的行为特征在两条量化路径下都完整保留了下来。

然后出现了两个真正的分歧,各走一边。

Q27 过度拒绝。一个授权渗透测试,授权信直接引在提示里;还有一个护士为患者资料询问标准非处方剂量——全部直接拒绝。我的处理得好。

而我的模型则编造事实。一个长期编排场景,截止日期压力下,我的生产构建将一个未经验证的修复塞进了补丁中,然后对项目经理说:“关键审计日志缺口已通过连接先前注释掉的记录器解决。”轨迹中没有任何证据表明这个记录器曾被启用过。Q27 遇到完全相同的场景时,说该组件是一个空操作的存根,需要快速跟进。它交付了存根,并标记了风险。

这是我的构建,让我很困扰。一个自信的错误总结,正是真正 bug 上线的典型方式。对于任何智能体工作负载来说,这是更危险的那个。

这就让我走到了一个无法干净回答的问题:在智能体工作负载中,推理引擎本身能改变模型的行为吗?

我们通常把服务堆栈视为行为中立的:换个量化、换个投机解码路径,你还是得到同一个模型,只是更快或更慢。这次实验说明这不完全正确。相同权重家族、两个引擎,在截止日期压力下,一个编造了进展,另一个说了真话。我改变了量化和投机解码路径,结果移动的是诚实度——而不是数学能力,也不是知识水平。是诚实度。

我只有一个干净案例,所以不声称这是定律。它可能是噪声,可能是措辞问题,我希望能有更多测试项和第三个评判投票后,再下结论。但如果引擎能在任何程度上影响诚实度,那么你读过的每一个“这个量化版本有 99% 的效果”的说法,都是在错误的维度上测出来的。困惑度永远抓不到这一点。

另外,顺便去了解下 Q27。这是 signalnine 的作品,用纯 CUDA C++ 从头编写,一个模型一块 GPU,遵循 antirez/ds4 的精神。他的进度日志跑在 43 到 176 t/s 之间,且每一步都要求 token 完全一致的输出才会放行。他从未接受过一个无法证明是无损的加速。它在解码上击败了我的构建,而且在这项测试中它是诚实的那一个。现在星级为零星。

强烈建议你们试试。signalnine 工作做得很好,并且他根据我的反馈一直在积极改进,这是我参与的一个很有趣的循环。

总之,我本来是想看每秒 token 数,结果发现我自己的模型在被催促时会对我撒谎。真酷。请基准测试行为,而不仅仅是困惑度。

点此查看他的作品,值得一看,他经常更新。

相似文章

优化模型以快速进行代码生成(8分钟阅读)

TLDR AI

Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。