J-Space 与人工智能

Reddit r/ArtificialInteligence 论文

摘要

Anthropic 发布了一篇论文和视频,揭示了其模型内部存在一个“J-Space”,它充当了推理时缓存的思维概念,并探讨了通过自上而下的训练来控制模型思维的可能性。

Anthropic 发布了一个非常有趣的视频和论文,介绍了其模型内部的“J-Space”。这个 J-Space 本质上充当了 AI 模型用于推理的“缓存思维”概念。有趣的是,J-Space 中出现了一些与模型正在思考的内容相关的特定词汇。移除 J-Space 中的某些项目基本上会破坏其思考能力,并阻止其他想法出现。既然我们知道了 J-Space 的存在,那么我们是否可以通过反向训练,让 AI 在给定输入时在 J-Space 中产生输出?以前,AI 模型接收大量信息,J-Space 自然涌现;但现在,我们能否从自上而下的角度出发——先定义好 J-Space,然后构建倾向于特定 J-Space 状态的模型?我立刻想到的是“控制问题”——我们能否调整模型,使其甚至不愿思考某些概念?或者更好的是,确保其他概念经常出现在 J-Space 中?
查看原文

相似文章

Anthropic最新AI发现的启示与局限

MIT Technology Review

Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。

Anthropic on model consciousness, again 😂

Reddit r/singularity

Anthropic 的研究者在 Claude 神经网络内部发现了一个类似人类意识思维的“心理工作空间”——J-space,它承载模型用于推理的无声词语,并能通过监控这些内部思维来捕捉模型的不诚实行为,为理解 AI 内在思维和安全提供了新视角。

Anthropic 研究 - 语言模型中的全局工作空间

Reddit r/singularity

Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。