J-Wash: 基于Anthropic的Jacobian-Lens对大型语言模型进行洗脑与定制的新方法
摘要
J-Wash是一款工具,利用Anthropic的Jacobian透镜,允许用户通过修改token方向来编辑大型语言模型的行为和身份,然后将编辑后的模型导出为独立检查点,无需训练或微调。
暂无内容
查看缓存全文
缓存时间: 2026/07/14 00:07
推出非专家友好型对齐!
相似文章
@hillbig: 大型语言模型被认为不仅预测下一个token,还会在内部维持中间概念……
本文引入雅可比透镜(J-lens)和J-空间,表明像Claude Sonnet 4.5这样的LLM维护着可语言化的内部表征,这些表征像一个全局工作空间,因果性地用于灵活推理——通过干预实验进行了验证。
Anthropic发现了一个隐藏空间,Claude在其中思考概念
Anthropic开发了雅可比透镜(J-lens),揭示了Claude Opus 4.6内部隐藏的'J空间',为在输出tokens之前洞察LLM内部推理过程提供了前所未有的视角。该技术通过呈现模型即将生成的词汇,实现了对模型行为的监控和控制。
@AnthropicAI:我们还与Neuronpedia合作,在开放权重模型上创建了我们方法的交互式演示。在此尝试:
Anthropic与Neuronpedia合作,发布了Jacobian Lens,这是一个在开放权重模型上解释其方法的交互式演示。
@arafatkatze: 受Anthropic的JSpace论文启发,我们@cline利用@modal搭建了一个公开演示,任何人都可以观看一个Jacobian-lens视角…
受Anthropic的JSpace论文启发,提供了一个Jacobian-lens视角的语言模型表示公开演示,允许用户跨层和令牌探索模型内部。
Chainwash:扩散语言模型水印的多步重写攻击
本研究论文介绍了Chainwash,一种多步重写攻击,能够有效删除扩散语言模型(LLaDA-8B-Instruct)输出中的统计水印,经过五次链式重写后,检测率从87.9%降至4.86%。