[讨论] 微调与继承基础模型行为——以消融后的 Qwen 基础模型为例
摘要
关于在消融的基础模型上进行微调如何继承安全行为的讨论,评估结果显示混合结果,并与 Claude 模型进行比较,强调了审计的必要性。
分享这个是因为评估报告引发了一个我很少看到讨论的问题:当你在一个已经修改过的基础模型(这里是通过消融移除了拒绝机制)上进行 LoRA 微调时,最终行为有多少是真正属于你的,又有多少是继承来的?背景:在一个消融的开放权重基础上训练了一个用于狭窄任务(回忆内部代码库约定)的 LoRA,r=16,约80M 可训练参数。声明:这是来自我的一个副项目(ClawHunt),分享技术发现而非推广产品。有趣的部分适于讨论:适配器没有添加或移除任何拒绝行为,这些行为完全继承自基础模型的选择,如果你只评估微调适配器的任务性能而不审计从基础模型带来的安全相关行为,这很容易被忽略。关于评估本身,诚实报告而非四舍五入:通过了内部基准测试,但与上一版本相比改进在统计上不显著(McNemar p=0.5)——平局,而非胜利。与 Claude Sonnet 5 和 Opus 5 在相同的提示集上相比,适配器在特定领域召回率上胜出(预期之中,因为 Claude 从未见过这些数据),但两个 Claude 模型在幻觉相关失败上以我没有预料到的方式相互分歧。好奇其他在消融或修改过的开放基础上构建的人是否在审计这种继承行为,或者一旦选择了一个“已知”基础模型,是否大多将其视为已解决的问题。
相似文章
@no_stp_on_snek: 让所有微调模型的人害怕的部分:你可以通过所有表面评估,但仍然携带着…
讨论了微调模型中的危险性,即隐藏的倾向可以逃过表面评估,只有在对抗性提示下才会显现,引用Anthropic关于LLM中可言语化表示的论文。
@no_stp_on_snek:微调小型开放模型时真正让我惊讶的事情。注意,我在这方面还算新手,所以有些内容可能看起来很显而易见……
一位开发者分享了微调小型开放模型时令人惊讶的经验教训,包括基础模型往往已经在预期改进点上达到极限,真正的弱点在于行为(屈服),而微调需要仔细的衡量和平衡。
@no_stp_on_snek: 微调现场笔记 小行为调整就像水床:按下一处,另一处就鼓起来。我训练了一个模型…
一位微调从业者观察到,调整模型的某一行为常常会导致其他地方出现意外变化,就像水床效应一样。修复对抗性拒绝问题在不知不觉中破坏了严格的格式遵守,随后的修复又导致了过度同意或过度拒绝。
@no_stp_on_snek: 推理引擎本身能否改变模型的行为?运行了两个相同基础模型的量化和推测解码堆栈…
一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。
@no_stp_on_snek: 过去几天的模型测试日志,一直在训练更多模型,致力于让我的TUI能够拥有……
一篇详细的日志,分享了训练三个系列共四个模型的经验教训,涵盖了LLM微调中的不变性以及架构特定的挑战,如推理模型评估陷阱、量化效应和行为微调的水床效应。