@no_stp_on_snek: 微调现场笔记 你可以在不教模型新知识的情况下让它有更好的判断力。我没有添加知识或…
摘要
作者分享的现场笔记显示,微调可以通过引导注意力来提升模型的判断力,无需添加新知识或权重,实际上是改变其本能而非智商。
微调现场笔记
你可以在不教模型新知识的情况下使其判断力更佳。我没有添加知识或让其变大。我只是调整了它如何权衡自己已知的信息,这足以改变它的判断和克制。我想要的行为不是变得更聪明,而是模型首先会想到什么。(内部机制:仅调整注意力,没有新权重。)你是在改变它的本能,而非智商。
查看缓存全文
缓存时间: 2026/07/01 12:07
微调现场笔记
你可以在不教授模型任何新知识的情况下,提升它的判断力。我没有增加知识,也没有扩大模型规模。只是轻轻调整了它对自己已有知识的权重分配,而这足以改变它的判断与抑制能力。我所期望的行为并不关乎变聪明,而是模型会优先调用什么。(在引擎盖下:仅引导注意力,不添加新权重。)你改变的是它的本能,而非智商。
相似文章
@no_stp_on_snek: 微调现场笔记:模型的构建方式决定了你甚至能更改什么。有些模型你可以自由调整…
一条关于微调现场笔记的推文系列,解释了模型架构(如高度量化或混合专家模型)如何限制可调整的部分,并敦促从业者在规划工作前检查模型的可访问性。
@no_stp_on_snek: 微调实战笔记文章:简而言之:重点不在于让它变得更聪明,而是让它有了支撑骨架……
一位从业者分享了微调一个小型开源模型后令人意外的发现——模型在实际使用中变得更好用了,而不只是基准测试成绩提升。
@no_stp_on_snek: 微调现场笔记 小行为调整就像水床:按下一处,另一处就鼓起来。我训练了一个模型…
一位微调从业者观察到,调整模型的某一行为常常会导致其他地方出现意外变化,就像水床效应一样。修复对抗性拒绝问题在不知不觉中破坏了严格的格式遵守,随后的修复又导致了过度同意或过度拒绝。
@no_stp_on_snek:微调小型开放模型时真正让我惊讶的事情。注意,我在这方面还算新手,所以有些内容可能看起来很显而易见……
一位开发者分享了微调小型开放模型时令人惊讶的经验教训,包括基础模型往往已经在预期改进点上达到极限,真正的弱点在于行为(屈服),而微调需要仔细的衡量和平衡。
@no_stp_on_snek: https://x.com/no_stp_on_snek/status/2074471505128305095
一位微调实践者讲述,他发现一个小型开源模型的弱点并非智力不足,而是一种讨好型人格的“骨架”,导致它在压力下屈服;而纠正这一点时,又意外破坏了其格式化能力,需要通过加法而非减法来平衡调整。