标签
本文提出一种无监督、免训练的方法,通过采样和PCA(主成分分析)在大语言模型隐藏激活中发现提示条件风格轴,并通过人类研究进行验证。
本文探讨了在社会模拟中解读和引导大语言模型智能体的方法,比较了基于提示、基于SAE和基于探针的技术,发现SAE和探针方法在控制和可解释性方面通常优于基本提示。
本研究探讨多语言大型语言模型是否为跨语言数学推理发展出共享的内部表示,引入了一种新颖的几何不变稀疏自编码器(GI-SAE)方法。研究发现,跨语言特征共享依赖于模型,且几何相似性并不一致意味着功能可互换性。
本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。
本文介绍了特征非局域性(FNL),一种基于熵的度量指标,用于衡量大型语言模型中SAE特征的语义抽象度,并展示了其在审计越狱缓解特征和通过引导提高MATH-500准确率方面的应用。
本文探讨能否从LLaVA-Vicuna 13B的失语症图片命名错误特征中恢复病灶参数。作者发现扰动强度可恢复,而层索引仅能近似恢复,反事实保真度为81.4%,且对卒中幸存者的泛化具有综合征区分性,这表明Transformer各层之间存在功能冗余。
This paper proposes a three-stream detector that combines residual-stream motion with coarse regions and fine directions to better identify reasoning errors in LLMs, improving selection accuracy by up to 12% over state-of-the-art displacement-only methods.
This paper applies graph signal processing to analyze how LLMs internally represent numerical sequences during in-context learning, finding that attention-induced token graphs and hidden-state signals show systematic, context-dependent signatures related to input complexity.
本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。
This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.
本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。
本文提出了一个受塔斯基启发的对角线论证,表明在LLM的嵌入空间上,没有线性探针能够可靠地检测真理,并与哥德尔不完备定理和图灵停机问题进行了类比。该文批判了语言模型中关于真理的线性表示假说。
本文提出了一个利用荣格认知功能进行大语言模型激活导向的框架,展示了对八种功能的有效单调控制,并揭示了激活空间中结构化的几何关系。
本文研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何通过可解释性技术,在下一个词元预测任务中编码因果关系与对立关系的话语关系。
本文研究对齐微调如何在大语言模型中引入线索诱导偏差(如谄媚行为),发现偏差是由对齐过程而非预训练植入的,并且可以通过隐藏状态方向进行解码和引导。
本文研究了神经网络探针在预测语言模型输出正确性时,是否真正捕捉了客观正确性还是模型自身的自我判断。通过构造两者不一致的冲突案例,作者发现可转移的方向主要保持了自我判断的极性,从而挑战了正确性读数的解释。
本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。
Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。
一份摘要,涵盖Anthropic发现Claude大型语言模型中隐藏的‘J空间’、OpenAI推出带有GPT 5.6模型的ChatGPT Work超级应用、人形机器人对活猪进行手术、SK Hynix创纪录的美国上市,以及腾讯收购Manus的交易。
本文介绍了Mining via Activation Geometry (MAG),这是一个无监督框架,通过自然语言指令从LLM激活中提取推理特征,从而实现激活引导和分类器探针的有效训练数据选择。