jacobian-lens

标签

Cards List
#jacobian-lens

适者的生存:Qwen3.6-27B的雅可比透镜无需重调即可读取并操控Qwen3.8-27B [R]

Reddit r/MachineLearning · 2026-08-15

本文测试了从Qwen3.6-27B到Qwen3.8-27B的雅可比可解释性透镜的可迁移性,发现对于特定任务,它可以在零重调的情况下读取并操控较新的模型。

0 人收藏 0 人点赞
#jacobian-lens

可言语化的表征构成语言模型中的全局工作空间

arXiv cs.AI · 2026-07-20 缓存

本文提供证据表明,语言模型维护着一套特权的内部表征(J-space),这些表征是可言语报告的,并且像全局工作空间一样运作,同时引入了雅可比透镜(Jacobian lens)可解释性技术。研究结果为模型认知提供了一个窗口,并对对齐与安全性具有启示意义。

0 人收藏 0 人点赞
#jacobian-lens

开放模型间的J-space比较

Hacker News Top · 2026-07-15 缓存

这篇博文延续了Anthropic的verbalizable workspace论文,通过测量中间层转向方向的影响范围、训练中结构的形成时机、结构在不同模型间的迁移性以及其扩展性,全部基于开放模型进行实验。

0 人收藏 0 人点赞
#jacobian-lens

J-Wash: 基于Anthropic的Jacobian-Lens对大型语言模型进行洗脑与定制的新方法

Reddit r/LocalLLaMA · 2026-07-13 缓存

J-Wash是一款工具,利用Anthropic的Jacobian透镜,允许用户通过修改token方向来编辑大型语言模型的行为和身份,然后将编辑后的模型导出为独立检查点,无需训练或微调。

0 人收藏 0 人点赞
#jacobian-lens

评估J-space熵在Qwen3-4B上的7个数据集中作为错误预测器的效果 [R]

Reddit r/MachineLearning · 2026-07-13

本研究评估了灵感来自Anthropic的Jacobian Lens的J-space熵能否在Qwen3-4B上的七个数据集中作为错误预测器。结果显示,它可以补充事实检索中的输出置信度,但它并非通用的幻觉检测器,且具有很强的任务依赖性。

0 人收藏 0 人点赞
#jacobian-lens

交互式 Jacobian-Lens 可视化工具和实时引导器,用于 llama.cpp 上的 GGUF 模型

Reddit r/LocalLLaMA · 2026-07-12

交互式 Jacobian-Lens 可视化工具和实时引导器,适用于在 llama.cpp 上运行的 GGUF 模型,实现实时模型可解释性和控制。

0 人收藏 0 人点赞
#jacobian-lens

我创建了一个超级有害的模型!:D(通过调整它的J-Space!!!)

Reddit r/LocalLLaMA · 2026-07-11

作者基于Anthropic的Jacobian-Lens创建了一个工具,用于手动调整模型的雅可比空间,生成了一个名为Nikusui-v1的无审查模型,并发布了GGUF量化版本。

0 人收藏 0 人点赞
#jacobian-lens

Anthropic发现了一个隐藏空间,Claude在其中思考概念

MIT Technology Review · 2026-07-09 缓存

Anthropic开发了雅可比透镜(J-lens),揭示了Claude Opus 4.6内部隐藏的'J空间',为在输出tokens之前洞察LLM内部推理过程提供了前所未有的视角。该技术通过呈现模型即将生成的词汇,实现了对模型行为的监控和控制。

0 人收藏 0 人点赞
#jacobian-lens

独一无二的J-Space(54分钟阅读)

TLDR AI · 2026-07-08 缓存

一篇讨论一种名为Jacobian Lens的新型可解释性技术的文章,以及J-space的发现,J-space是LLMs中的一个区域,其中可语言化的表征形成了一个全局工作空间,标志着理解LLM推理的重大进展。

0 人收藏 0 人点赞
#jacobian-lens

@arafatkatze: 受Anthropic的JSpace论文启发,我们@cline利用@modal搭建了一个公开演示,任何人都可以观看一个Jacobian-lens视角…

X AI KOLs Following · 2026-07-07 缓存

受Anthropic的JSpace论文启发,提供了一个Jacobian-lens视角的语言模型表示公开演示,允许用户跨层和令牌探索模型内部。

0 人收藏 0 人点赞
#jacobian-lens

我在开放模型上测试了Anthropic的新Jacobian Lens,然后它变成了一个本地模型幻觉路由器

Reddit r/LocalLLaMA · 2026-07-07

作者在开放模型上测试了Anthropic的Jacobian Lens,然后它演变成了一个用于检测AI幻觉的本地模型幻觉路由器

0 人收藏 0 人点赞
#jacobian-lens

你现在可以直接观察语言模型的思考过程。我构建了一种可视化AI未说出口的词语的方法

Reddit r/artificial · 2026-07-06

一位开发者构建了Subtext,这是一个利用Anthropic的Jacobian lens可视化语言模型内部“无声词汇”的工具,可以在模型输出token之前实时观察其推理过程。该工具可在单块12GB GPU上运行,并以全生成速度流式输出。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈