标签
本文表明,轻度压缩的大语言模型能够通过标准的无数据质量门禁(困惑度、MMLU、输出保真度),但在用作智能体时仍会编造程序步骤,并提出一种无数据双轴筛查方法,以便在部署前检测此类失败。
一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。