标签
本文介绍了点火指数(Ignition Index),一种用于测量语言模型中全局工作空间动态的度量指标,已在多种架构和任务上得到验证,显示出对类似点火的表征转换的选择性检测。
Anthropic的新研究引入了'J-lens',一种在输出前读取Claude内部激活的方法,揭示了一个在功能上类似于人类全局工作空间理论的安静工作空间。这允许检测隐藏的推理、目标以及提示注入等潜在安全问题。
作者分享了一个使用 Python、Gemini 和 Ollama 构建的可本地运行的 AI 伴侣,其特色是基于全局工作空间理论和集成信息理论代理的定制认知架构,用于人格建模。