J-Wash: 基于Anthropic的Jacobian-Lens对大型语言模型进行洗脑与定制的新方法

Reddit r/LocalLLaMA 工具

摘要

J-Wash是一款工具,利用Anthropic的Jacobian透镜,允许用户通过修改token方向来编辑大型语言模型的行为和身份,然后将编辑后的模型导出为独立检查点,无需训练或微调。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/14 00:07

推出非专家友好型对齐!

相似文章

Anthropic发现了一个隐藏空间,Claude在其中思考概念

MIT Technology Review

Anthropic开发了雅可比透镜(J-lens),揭示了Claude Opus 4.6内部隐藏的'J空间',为在输出tokens之前洞察LLM内部推理过程提供了前所未有的视角。该技术通过呈现模型即将生成的词汇,实现了对模型行为的监控和控制。