标签
一项新研究挑战了关于神经元的传统假设,表明它们可以同时执行多种计算,这意味着脑细胞的计算能力远超此前认知。
本文正式定义了不完整提示越狱(IPJ),这是一种漏洞,当不完整的恶意提示导致大型语言模型生成有害的延续内容时,并分析了吸引子类型和神经元层面的防御机制。
科学家首次记录双语者大脑中的单个神经元,发现大脑并非通过共享神经元翻译词汇,而是将每种语言组织成具有相同结构的语义几何地图,类似于大语言模型中的向量空间同构。
Oswald Steward及其同事因发现神经元可在突触附近产生蛋白质而获得2026年卡夫利神经科学奖,这一发现从根本上改变了人们对记忆和大脑可塑性的理解。
罗格斯大学研究人员将 LLM 中的引文幻觉追溯到稀疏的字段特异性神经元,并通过因果干预抑制虚假引用。
# 语言模型可以解释语言模型中的神经元 来源:[https://openai.com/index/language-models-can-explain-neurons-in-language-models/](https://openai.com/index/language-models-can-explain-neurons-in-language-models/) 虽然我们的大多数解释得分较低,但我们相信现在可以使用机器学习技术进一步改进我们生成解释的能力。例如,我们发现我们能够通过以下方式提高得分:- *迭代解释*。我们可以通过增加得分来