适者的生存:Qwen3.6-27B的雅可比透镜无需重调即可读取并操控Qwen3.8-27B [R]
摘要
本文测试了从Qwen3.6-27B到Qwen3.8-27B的雅可比可解释性透镜的可迁移性,发现对于特定任务,它可以在零重调的情况下读取并操控较新的模型。
可解释性透镜通常针对一个确切的检查点进行拟合,据我所知,没有人测试过版本更新对其的影响。因此,我的问题是:当一个模型系列更新时,拟合的工具是否仍然有效,还是需要为每个版本重新拟合?
我测试了已发布的Qwen3.6-27B的雅可比透镜(来自Neuronpedia,基于Anthropic七月的工作空间论文),并将其未更改地应用于Qwen3.8-27B。设置:3.8-27B在3.6-27B之后113天发布。相同的64层,相同的隐藏维度,相同的分词器,训练关系未公开。一个协议,两个模型,每个模型两种读取方式:传输的雅可比读取和原始逻辑透镜作为基线。bf16精度,贪心算法,单种子。
读取结果:主要任务是40个两跳提示,其中中间实体从未被陈述。例如:'事实:形状像靴子的国家所使用的货币是',其中目标是意大利,而意大利在提示中未出现。传输的透镜将潜在实体保持在248,320个词元词汇表的顶部附近。在第48层,原始模型的中位数排名是4,而传输后为17。在第24层,排名为121 vs 38,因此在中间深度,后续模型实际上更好(配对符号检验,p < 1e-3)。在两个模型上,原始逻辑透镜在同一区域的排名在1e3到1e4之间。在WikiText教师强制下下一个词元(700个位置)上,传输成本在网络中间为1.2到1.3倍,在第48层约为2倍。潜在内容读取几乎干净地传输;表面下一个词元读取成本更高,且在后期支付。
操控结果:我从3.6透镜中提取了'悖论'/'悖论的'/'矛盾'/'矛盾'的拉回方向,在层内正交化,并在生成过程中从第18到47层将它们投影出3.8的残差流。提示:'描述埃舍尔不可能的楼梯'。在所有单元格中,两个模型上,'悖论'一词都从输出中消失,而描述保持连贯(版画、闭环、幻觉都完整)。完全从旧检查点提取的方向仍然在新模型中找到该概念。
范围:一个透镜家族,一个模型系列,一个版本步骤,匹配的架构和分词器。设计无法完全将透镜不匹配与模型更改分离,我不声称跨家族传输或更大差距。实际结果是,跨检查点传输是可测量的,因此监控管道可以测试其透镜,而不是假设需要重新拟合。
评估代码、40个提示集、所有四个模型-by-读取单元格的每层排名表和消融捕获:https://huggingface.co/datasets/ec75hash/jacobian-lens-transfer-qwen36-38
乐意回答有关协议的问题,或听取您认为它在哪里失效。
相似文章
Qwen3.8-27B 与 Qwen3.6-27B 完全相同!
Qwen3.8-27B 在架构上与 Qwen3.6-27B 完全相同,所有能力提升都归功于训练改进。
Qwen3.8-27B 与 Qwen3.6-27B 在 BASIC 中编写光线追踪程序
一位爱好者比较了 Qwen3.8 和 Qwen3.6 AI 模型在生成 BASIC 光线追踪代码方面的表现,发现 Qwen3.8 能够独立迭代出更好的结果。
@no_stp_on_snek: Qwen3.8 27B 概览。版本 3.6:退步:* 偏见/公平性 * 配置易用性 增强:* 核心 * 能力 结论…
本文评估了Qwen3.8 27B AI模型的3.6版本,强调了在偏见/公平性和配置易用性方面的退步,同时指出了在核心和能力方面的改进,得出结论:这不是一次干净的升级。
本地之王归来!Qwen3.8-27B 性能图表
Qwen3.8-27B 是一款新的本地可运行模型,据报道其性能超越之前的本地模型,可与 Opus4.6 媲美,并分享了基准测试图表以及 ModelScope 和 HuggingFace 的链接。
Qwen 3.8 27B 发布:开放权重,目前最好的本地稠密模型
Qwen 发布了 Qwen3.8-27B,这是一个开放权重的 27B 稠密视觉语言模型,在编程、专业工作和长周期智能体任务上取得了重大进展,提供 FP8 版本并支持灵活的思考控制。