llm-interpretability

标签

Cards List
#llm-interpretability

从失语症图片命名错误特征中恢复大型语言模型的病灶参数

arXiv cs.CL · 昨天 缓存

本文探讨能否从LLaVA-Vicuna 13B的失语症图片命名错误特征中恢复病灶参数。作者发现扰动强度可恢复,而层索引仅能近似恢复,反事实保真度为81.4%,且对卒中幸存者的泛化具有综合征区分性,这表明Transformer各层之间存在功能冗余。

0 人收藏 0 人点赞
#llm-interpretability

Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

arXiv cs.LG · 4天前 缓存

This paper proposes a three-stream detector that combines residual-stream motion with coarse regions and fine directions to better identify reasoning errors in LLMs, improving selection accuracy by up to 12% over state-of-the-art displacement-only methods.

0 人收藏 0 人点赞
#llm-interpretability

A Graph Signal Processing Perspective on Numerical Sequence Representations in LLM In-Context Learning

arXiv cs.LG · 6天前 缓存

This paper applies graph signal processing to analyze how LLMs internally represent numerical sequences during in-context learning, finding that attention-induced token graphs and hidden-state signals show systematic, context-dependent signatures related to input complexity.

0 人收藏 0 人点赞
#llm-interpretability

引导向量中的反向检测与控制

arXiv cs.LG · 6天前 缓存

本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。

0 人收藏 0 人点赞
#llm-interpretability

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

arXiv cs.AI · 2026-07-31 缓存

This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.

0 人收藏 0 人点赞
#llm-interpretability

思维链不忠实性的两种模式:模型出错时行为检测失效

arXiv cs.CL · 2026-07-28 缓存

本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。

0 人收藏 0 人点赞
#llm-interpretability

真理不是方向:塔斯基对LLM探针的批判

Hacker News Top · 2026-07-27 缓存

本文提出了一个受塔斯基启发的对角线论证,表明在LLM的嵌入空间上,没有线性探针能够可靠地检测真理,并与哥德尔不完备定理和图灵停机问题进行了类比。该文批判了语言模型中关于真理的线性表示假说。

0 人收藏 0 人点赞
#llm-interpretability

人格的几何结构:基于荣格认知功能的激活导向

arXiv cs.CL · 2026-07-24 缓存

本文提出了一个利用荣格认知功能进行大语言模型激活导向的框架,展示了对八种功能的有效单调控制,并揭示了激活空间中结构化的几何关系。

0 人收藏 0 人点赞
#llm-interpretability

为什么?解读模型对因果关系与对立关系的编码

arXiv cs.CL · 2026-07-22 缓存

本文研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何通过可解释性技术,在下一个词元预测任务中编码因果关系与对立关系的话语关系。

0 人收藏 0 人点赞
#llm-interpretability

对齐微调如何塑造大语言模型中的谄媚及相关线索诱导偏差的表征?

arXiv cs.CL · 2026-07-21 缓存

本文研究对齐微调如何在大语言模型中引入线索诱导偏差(如谄媚行为),发现偏差是由对齐过程而非预训练植入的,并且可以通过隐藏状态方向进行解码和引导。

0 人收藏 0 人点赞
#llm-interpretability

自我判断混淆下正确性探测的诊断

arXiv cs.CL · 2026-07-21 缓存

本文研究了神经网络探针在预测语言模型输出正确性时,是否真正捕捉了客观正确性还是模型自身的自我判断。通过构造两者不一致的冲突案例,作者发现可转移的方向主要保持了自我判断的极性,从而挑战了正确性读数的解释。

0 人收藏 0 人点赞
#llm-interpretability

信念与现实分离存在于语言模型中对共享值槽的路由中

arXiv cs.CL · 2026-07-15 缓存

本文探讨了语言模型如何将角色的信念与现实分离,发现它们使用共享值槽来存储属性值,并在查询位置使用路由器来选择读取的框架(信念或现实)。它识别出断言信念和衍生信念的两条路径,并表明该值槽本身不携带信念-现实标签;分离存在于解耦的路由子空间中。

0 人收藏 0 人点赞
#llm-interpretability

Anthropic最新AI发现的启示与局限

MIT Technology Review · 2026-07-13 缓存

Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。

0 人收藏 0 人点赞
#llm-interpretability

The Download:Claude的内部运作与OpenAI的“超级应用”

MIT Technology Review · 2026-07-10 缓存

一份摘要,涵盖Anthropic发现Claude大型语言模型中隐藏的‘J空间’、OpenAI推出带有GPT 5.6模型的ChatGPT Work超级应用、人形机器人对活猪进行手术、SK Hynix创纪录的美国上市,以及腾讯收购Manus的交易。

0 人收藏 0 人点赞
#llm-interpretability

基于激活几何的无监督特征挖掘

arXiv cs.AI · 2026-07-07 缓存

本文介绍了Mining via Activation Geometry (MAG),这是一个无监督框架,通过自然语言指令从LLM激活中提取推理特征,从而实现激活引导和分类器探针的有效训练数据选择。

0 人收藏 0 人点赞
#llm-interpretability

Contrastive Decoding Diffing (CDD): 仅通过logits恢复逐字微调数据,无需权重访问[R]

Reddit r/MachineLearning · 2026-07-03

本文介绍了对比解码差异法(CDD),该方法仅通过logits访问即可从LLM中恢复逐字微调数据,无需模型权重或激活。它在多个模型系列中展示了高水平的逐字恢复能力,并揭示了意外数据泄露,例如来自合成训练数据的反复出现的虚构角色'Dr. Elena Rodriguez'。

0 人收藏 0 人点赞
#llm-interpretability

模型在哪里找到快乐?开源LLM中的情感向量

arXiv cs.CL · 2026-06-26 缓存

本文复现了开源权重大语言模型Apertus-8B和Gemma-4-E4B中'情感向量'的发现,表明价态几何结构在不同模型间可恢复,但层间出现时机存在差异。研究还发现唤醒编码对用于提取的故事语料库敏感。

0 人收藏 0 人点赞
#llm-interpretability

@DanKornas: LLM 可解释性是个深坑。这个仓库为你提供了地图。Awesome LLM Interpretability 是一个精选的 GitHub 列表……

X AI KOLs Timeline · 2026-06-21 缓存

这是一个精选的 GitHub 列表,汇总了 LLM 可解释性领域的工具、论文和社区,帮助研究人员高效地了解该领域。

0 人收藏 0 人点赞
#llm-interpretability

@GitHub_Daily: 大语言模型内部是如何工作的,为什么会产生幻觉,为什么有时答非所问,想深入了解这些。 可以看下 Awesome LLM Interpretability 这份资源合集,提供一整套拆解 AI 黑盒的系统路径。 涵盖从注意力可视化、神经元分析到…

X AI KOLs Timeline · 2026-06-18 缓存

介绍了一个名为 Awesome LLM Interpretability 的资源合集,汇集了多种可解释性工具、论文和社区资源,帮助理解大语言模型的内部工作机制。

0 人收藏 0 人点赞
#llm-interpretability

构建更好的Activation Oracles

arXiv cs.LG · 2026-06-03 缓存

本文介绍了对Activation Oracles (AOs)的改进,用于解释残差流激活,包括新的对话数据集、多层注入和基于策略的训练。作者还发布了AObench,这是首个用于评估AO质量的全面评估套件。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈