[讨论] 微调与继承基础模型行为——以消融后的 Qwen 基础模型为例

Reddit r/artificial 新闻

摘要

关于在消融的基础模型上进行微调如何继承安全行为的讨论,评估结果显示混合结果,并与 Claude 模型进行比较,强调了审计的必要性。

分享这个是因为评估报告引发了一个我很少看到讨论的问题:当你在一个已经修改过的基础模型(这里是通过消融移除了拒绝机制)上进行 LoRA 微调时,最终行为有多少是真正属于你的,又有多少是继承来的?背景:在一个消融的开放权重基础上训练了一个用于狭窄任务(回忆内部代码库约定)的 LoRA,r=16,约80M 可训练参数。声明:这是来自我的一个副项目(ClawHunt),分享技术发现而非推广产品。有趣的部分适于讨论:适配器没有添加或移除任何拒绝行为,这些行为完全继承自基础模型的选择,如果你只评估微调适配器的任务性能而不审计从基础模型带来的安全相关行为,这很容易被忽略。关于评估本身,诚实报告而非四舍五入:通过了内部基准测试,但与上一版本相比改进在统计上不显著(McNemar p=0.5)——平局,而非胜利。与 Claude Sonnet 5 和 Opus 5 在相同的提示集上相比,适配器在特定领域召回率上胜出(预期之中,因为 Claude 从未见过这些数据),但两个 Claude 模型在幻觉相关失败上以我没有预料到的方式相互分歧。好奇其他在消融或修改过的开放基础上构建的人是否在审计这种继承行为,或者一旦选择了一个“已知”基础模型,是否大多将其视为已解决的问题。
查看原文

相似文章