标签
本文测试了从Qwen3.6-27B到Qwen3.8-27B的雅可比可解释性透镜的可迁移性,发现对于特定任务,它可以在零重调的情况下读取并操控较新的模型。
本文提供证据表明,语言模型维护着一套特权的内部表征(J-space),这些表征是可言语报告的,并且像全局工作空间一样运作,同时引入了雅可比透镜(Jacobian lens)可解释性技术。研究结果为模型认知提供了一个窗口,并对对齐与安全性具有启示意义。
这篇博文延续了Anthropic的verbalizable workspace论文,通过测量中间层转向方向的影响范围、训练中结构的形成时机、结构在不同模型间的迁移性以及其扩展性,全部基于开放模型进行实验。
J-Wash是一款工具,利用Anthropic的Jacobian透镜,允许用户通过修改token方向来编辑大型语言模型的行为和身份,然后将编辑后的模型导出为独立检查点,无需训练或微调。
本研究评估了灵感来自Anthropic的Jacobian Lens的J-space熵能否在Qwen3-4B上的七个数据集中作为错误预测器。结果显示,它可以补充事实检索中的输出置信度,但它并非通用的幻觉检测器,且具有很强的任务依赖性。
交互式 Jacobian-Lens 可视化工具和实时引导器,适用于在 llama.cpp 上运行的 GGUF 模型,实现实时模型可解释性和控制。
作者基于Anthropic的Jacobian-Lens创建了一个工具,用于手动调整模型的雅可比空间,生成了一个名为Nikusui-v1的无审查模型,并发布了GGUF量化版本。
Anthropic开发了雅可比透镜(J-lens),揭示了Claude Opus 4.6内部隐藏的'J空间',为在输出tokens之前洞察LLM内部推理过程提供了前所未有的视角。该技术通过呈现模型即将生成的词汇,实现了对模型行为的监控和控制。
一篇讨论一种名为Jacobian Lens的新型可解释性技术的文章,以及J-space的发现,J-space是LLMs中的一个区域,其中可语言化的表征形成了一个全局工作空间,标志着理解LLM推理的重大进展。
受Anthropic的JSpace论文启发,提供了一个Jacobian-lens视角的语言模型表示公开演示,允许用户跨层和令牌探索模型内部。
作者在开放模型上测试了Anthropic的Jacobian Lens,然后它演变成了一个用于检测AI幻觉的本地模型幻觉路由器
一位开发者构建了Subtext,这是一个利用Anthropic的Jacobian lens可视化语言模型内部“无声词汇”的工具,可以在模型输出token之前实时观察其推理过程。该工具可在单块12GB GPU上运行,并以全生成速度流式输出。