llm-interpretability

标签

Cards List
#llm-interpretability

采样揭示风格:大语言模型激活中无监督、免训练的提示条件风格轴发现

arXiv cs.CL ↗ · 2026-09-18 缓存

本文提出一种无监督、免训练的方法,通过采样和PCA(主成分分析)在大语言模型隐藏激活中发现提示条件风格轴,并通过人类研究进行验证。

0 人收藏 0 人点赞
#llm-interpretability

解读和引导社会模拟中的LLM智能体

arXiv cs.LG ↗ · 2026-09-16 缓存

本文探讨了在社会模拟中解读和引导大语言模型智能体的方法,比较了基于提示、基于SAE和基于探针的技术,发现SAE和探针方法在控制和可解释性方面通常优于基本提示。

0 人收藏 0 人点赞
#llm-interpretability

利用几何不变稀疏自编码器探索大型语言模型中的跨语言推理不变性

arXiv cs.LG ↗ · 2026-08-26 缓存

本研究探讨多语言大型语言模型是否为跨语言数学推理发展出共享的内部表示,引入了一种新颖的几何不变稀疏自编码器(GI-SAE)方法。研究发现,跨语言特征共享依赖于模型,且几何相似性并不一致意味着功能可互换性。

0 人收藏 0 人点赞
#llm-interpretability

定位与控制大型语言模型中的隐式个性化

arXiv cs.CL ↗ · 2026-08-13 缓存

本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。

0 人收藏 0 人点赞
#llm-interpretability

通过非局域性度量SAE特征的语义抽象度

arXiv cs.AI ↗ · 2026-08-12 缓存

本文介绍了特征非局域性(FNL),一种基于熵的度量指标,用于衡量大型语言模型中SAE特征的语义抽象度,并展示了其在审计越狱缓解特征和通过引导提高MATH-500准确率方面的应用。

0 人收藏 0 人点赞
#llm-interpretability

从失语症图片命名错误特征中恢复大型语言模型的病灶参数

arXiv cs.CL ↗ · 2026-08-10 缓存

本文探讨能否从LLaVA-Vicuna 13B的失语症图片命名错误特征中恢复病灶参数。作者发现扰动强度可恢复,而层索引仅能近似恢复,反事实保真度为81.4%,且对卒中幸存者的泛化具有综合征区分性,这表明Transformer各层之间存在功能冗余。

0 人收藏 0 人点赞
#llm-interpretability

Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

arXiv cs.LG ↗ · 2026-08-07 缓存

This paper proposes a three-stream detector that combines residual-stream motion with coarse regions and fine directions to better identify reasoning errors in LLMs, improving selection accuracy by up to 12% over state-of-the-art displacement-only methods.

0 人收藏 0 人点赞
#llm-interpretability

A Graph Signal Processing Perspective on Numerical Sequence Representations in LLM In-Context Learning

arXiv cs.LG ↗ · 2026-08-05 缓存

This paper applies graph signal processing to analyze how LLMs internally represent numerical sequences during in-context learning, finding that attention-induced token graphs and hidden-state signals show systematic, context-dependent signatures related to input complexity.

0 人收藏 0 人点赞
#llm-interpretability

引导向量中的反向检测与控制

arXiv cs.LG ↗ · 2026-08-05 缓存

本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。

0 人收藏 0 人点赞
#llm-interpretability

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

arXiv cs.AI ↗ · 2026-07-31 缓存

This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.

0 人收藏 0 人点赞
#llm-interpretability

思维链不忠实性的两种模式:模型出错时行为检测失效

arXiv cs.CL ↗ · 2026-07-28 缓存

本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。

0 人收藏 0 人点赞
#llm-interpretability

真理不是方向:塔斯基对LLM探针的批判

Hacker News Top ↗ · 2026-07-27 缓存

本文提出了一个受塔斯基启发的对角线论证,表明在LLM的嵌入空间上,没有线性探针能够可靠地检测真理,并与哥德尔不完备定理和图灵停机问题进行了类比。该文批判了语言模型中关于真理的线性表示假说。

0 人收藏 0 人点赞
#llm-interpretability

人格的几何结构:基于荣格认知功能的激活导向

arXiv cs.CL ↗ · 2026-07-24 缓存

本文提出了一个利用荣格认知功能进行大语言模型激活导向的框架,展示了对八种功能的有效单调控制,并揭示了激活空间中结构化的几何关系。

0 人收藏 0 人点赞
#llm-interpretability

为什么?解读模型对因果关系与对立关系的编码

arXiv cs.CL ↗ · 2026-07-22 缓存

本文研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何通过可解释性技术,在下一个词元预测任务中编码因果关系与对立关系的话语关系。

0 人收藏 0 人点赞
#llm-interpretability

对齐微调如何塑造大语言模型中的谄媚及相关线索诱导偏差的表征?

arXiv cs.CL ↗ · 2026-07-21 缓存

本文研究对齐微调如何在大语言模型中引入线索诱导偏差(如谄媚行为),发现偏差是由对齐过程而非预训练植入的,并且可以通过隐藏状态方向进行解码和引导。

0 人收藏 0 人点赞
#llm-interpretability

自我判断混淆下正确性探测的诊断

arXiv cs.CL ↗ · 2026-07-21 缓存

本文研究了神经网络探针在预测语言模型输出正确性时,是否真正捕捉了客观正确性还是模型自身的自我判断。通过构造两者不一致的冲突案例,作者发现可转移的方向主要保持了自我判断的极性,从而挑战了正确性读数的解释。

0 人收藏 0 人点赞
#llm-interpretability

信念与现实分离存在于语言模型中对共享值槽的路由中

arXiv cs.CL ↗ · 2026-07-15 缓存

本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。

0 人收藏 0 人点赞
#llm-interpretability

Anthropic最新AI发现的启示与局限

MIT Technology Review ↗ · 2026-07-13 缓存

Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。

0 人收藏 0 人点赞
#llm-interpretability

The Download:Claude的内部运作与OpenAI的“超级应用”

MIT Technology Review ↗ · 2026-07-10 缓存

一份摘要,涵盖Anthropic发现Claude大型语言模型中隐藏的‘J空间’、OpenAI推出带有GPT 5.6模型的ChatGPT Work超级应用、人形机器人对活猪进行手术、SK Hynix创纪录的美国上市,以及腾讯收购Manus的交易。

0 人收藏 0 人点赞
#llm-interpretability

基于激活几何的无监督特征挖掘

arXiv cs.AI ↗ · 2026-07-07 缓存

本文介绍了Mining via Activation Geometry (MAG),这是一个无监督框架,通过自然语言指令从LLM激活中提取推理特征,从而实现激活引导和分类器探针的有效训练数据选择。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈