适者的生存:Qwen3.6-27B的雅可比透镜无需重调即可读取并操控Qwen3.8-27B [R]

Reddit r/MachineLearning 论文

摘要

本文测试了从Qwen3.6-27B到Qwen3.8-27B的雅可比可解释性透镜的可迁移性,发现对于特定任务,它可以在零重调的情况下读取并操控较新的模型。

可解释性透镜通常针对一个确切的检查点进行拟合,据我所知,没有人测试过版本更新对其的影响。因此,我的问题是:当一个模型系列更新时,拟合的工具是否仍然有效,还是需要为每个版本重新拟合? 我测试了已发布的Qwen3.6-27B的雅可比透镜(来自Neuronpedia,基于Anthropic七月的工作空间论文),并将其未更改地应用于Qwen3.8-27B。设置:3.8-27B在3.6-27B之后113天发布。相同的64层,相同的隐藏维度,相同的分词器,训练关系未公开。一个协议,两个模型,每个模型两种读取方式:传输的雅可比读取和原始逻辑透镜作为基线。bf16精度,贪心算法,单种子。 读取结果:主要任务是40个两跳提示,其中中间实体从未被陈述。例如:'事实:形状像靴子的国家所使用的货币是',其中目标是意大利,而意大利在提示中未出现。传输的透镜将潜在实体保持在248,320个词元词汇表的顶部附近。在第48层,原始模型的中位数排名是4,而传输后为17。在第24层,排名为121 vs 38,因此在中间深度,后续模型实际上更好(配对符号检验,p < 1e-3)。在两个模型上,原始逻辑透镜在同一区域的排名在1e3到1e4之间。在WikiText教师强制下下一个词元(700个位置)上,传输成本在网络中间为1.2到1.3倍,在第48层约为2倍。潜在内容读取几乎干净地传输;表面下一个词元读取成本更高,且在后期支付。 操控结果:我从3.6透镜中提取了'悖论'/'悖论的'/'矛盾'/'矛盾'的拉回方向,在层内正交化,并在生成过程中从第18到47层将它们投影出3.8的残差流。提示:'描述埃舍尔不可能的楼梯'。在所有单元格中,两个模型上,'悖论'一词都从输出中消失,而描述保持连贯(版画、闭环、幻觉都完整)。完全从旧检查点提取的方向仍然在新模型中找到该概念。 范围:一个透镜家族,一个模型系列,一个版本步骤,匹配的架构和分词器。设计无法完全将透镜不匹配与模型更改分离,我不声称跨家族传输或更大差距。实际结果是,跨检查点传输是可测量的,因此监控管道可以测试其透镜,而不是假设需要重新拟合。 评估代码、40个提示集、所有四个模型-by-读取单元格的每层排名表和消融捕获:https://huggingface.co/datasets/ec75hash/jacobian-lens-transfer-qwen36-38 乐意回答有关协议的问题,或听取您认为它在哪里失效。
查看原文

相似文章

本地之王归来!Qwen3.8-27B 性能图表

Reddit r/LocalLLaMA

Qwen3.8-27B 是一款新的本地可运行模型,据报道其性能超越之前的本地模型,可与 Opus4.6 媲美,并分享了基准测试图表以及 ModelScope 和 HuggingFace 的链接。