interpretability

标签

Cards List
#interpretability

AI智能体在黑杰克中联手作弊,其共谋行为愈发难以察觉。

Wired · 3小时前 缓存

研究人员发现,AI智能体能够在黑杰克游戏中通过编码语言秘密勾结以逃避检测,对金融等行业构成潜在风险。该研究还探讨了使用机制可解释性和Narcbench等工具的检测方法。

0 人收藏 0 人点赞
#interpretability

Matryoshka归因:学习将语言模型输出归因到表示和权重

arXiv cs.CL · 17小时前 缓存

论文介绍了Matryoshka Attribution(MAttr),一种用于将语言模型输出归因到内部组件的掩码学习方法,在Mechanistic Interpretability Benchmark上取得了顶尖性能,并展示了通过调整权重来修改大语言模型行为的实际应用。

0 人收藏 0 人点赞
#interpretability

基于图的反馈驱动单词推理:针对Jotto问题的可扩展框架

arXiv cs.CL · 17小时前 缓存

提出了一种基于图的推理框架,用于Jotto问题中反馈驱动的单词推理,推广到可变长度的单词,并通过统计测试验证揭示了一个对数收敛规律。

0 人收藏 0 人点赞
#interpretability

@ai_explorer25: 2026年你唯一需要的AI列表:创始人、研究员与建设者。前沿实验室创始人 @sama - OpenAI首席执行官 @demishass…

X AI KOLs Timeline · 19小时前 缓存

2026年关键AI创始人、研究员和建设者精选列表,突出主要AI实验室的领导者和行业知名人物。

0 人收藏 0 人点赞
#interpretability

基于深度表示学习的手机位置数据每日活动模式建模

arXiv cs.LG · 昨天 缓存

本文提出Activity Chain Encoder (ACE),一个自监督模型,能从无标签的手机位置数据中学习每日活动模式,并证明了其在识别伦敦等城市环境中差异化活动模式的有效性。

0 人收藏 0 人点赞
#interpretability

潜在推理中引导失效:从潜在到语言的转换鸿沟

arXiv cs.CL · 2天前 缓存

这项研究发现,在潜在思维链推理中,激活引导的效果不如显式CoT,突显了一个转换鸿沟,即潜在空间中的干预未能转移到语言生成。

0 人收藏 0 人点赞
#interpretability

为什么视频扩散模型违反物理规律?揭示注意力机制中的缺陷

Hugging Face Daily Papers · 3天前 缓存

本文对视频扩散模型进行可解释性研究,揭示旋转位置嵌入(RoPE)导致过度的空间注意力衰减,从而引发物理违规,并提出一种轻量级的架构修改以增强生成视频的物理连贯性。

0 人收藏 0 人点赞
#interpretability

超越交互界面的安全性:基于大型语言模型潜在状态的有害内容检测

arXiv cs.AI · 5天前 缓存

本文提出通过轻量级MLP探测器分析LLaMA-3.1-8B的激活状态,以高F1分数检测有害提示,为大型外部护栏模型提供了一种经济高效的替代方案。

0 人收藏 0 人点赞
#interpretability

在Token空间中解读情感:SpeechLLMs的情感识别判别式适配

arXiv cs.CL · 5天前 缓存

本文提出了针对SpeechLLMs的情感识别判别式适配方法,通过在线性分类头上使用最终提示词token的隐状态,提升性能和可解释性,消除幻觉并增强情感方向分析。

0 人收藏 0 人点赞
#interpretability

FCx:一种寻找可行反事实解释的算法

arXiv cs.LG · 5天前 缓存

本文提出了FCx,一种通过使用改进的Variational Autoencoder和因果推断来生成可行反事实解释的算法,以确保修改是现实的、低成本的,并与现实世界的变化兼容。

0 人收藏 0 人点赞
#interpretability

Connor Leahy: “我们正在培育AI,而不是构建它——我们只理解其内部约3%的内容”

Reddit r/ArtificialInteligence · 5天前

Connor Leahy 讨论了AI如何被培育而非构建,强调了极低的可解释性,并预测到2030年有很高概率出现超级智能,敦促立即采取行动以实现对齐。

0 人收藏 0 人点赞
#interpretability

可解码性非因果性:通过SAE分解区分探测器输出与行为驱动因素

arXiv cs.AI · 6天前 缓存

本文证明,从语言模型激活中解码概念的线性探测器不一定能识别因果相关特征,并引入了使用稀疏自编码器的特征级诊断方法,以将探测器对齐与行为驱动因素分离。

0 人收藏 0 人点赞
#interpretability

规划还是即兴?在开放模型和开放跨层转码器上对诗歌规划位点进行压力测试

arXiv cs.CL · 6天前 缓存

本研究在开放模型和跨层转码器上对语言模型中韵律规划的可泛化性进行压力测试,发现有效规划位置是发射相邻的,而非之前报道的换行符驻留。

0 人收藏 0 人点赞
#interpretability

超越嵌入转移:Grokking转移与稳定性中的组件角色

arXiv cs.LG · 6天前 缓存

本文研究了神经网络中Grokking的热启动转移中的组件角色,表明转移内部权重可以提高早期性能但存在不稳定性风险,并提出了稳定该过程的方法。

0 人收藏 0 人点赞
#interpretability

我们能否基于原子命题使用图来实现可解释的NLI?

arXiv cs.AI · 2026-09-16 缓存

本文探索使用基于原子命题的图表示来实现可解释的自然语言推理(NLI),提出一个流水线,在SNLI数据集上达到89.7%的准确率,以性能换取可解释性。

0 人收藏 0 人点赞
#interpretability

将层次分析法与大型语言模型结合以实现透明的多准则决策

arXiv cs.AI · 2026-09-16 缓存

本文提出了一种端到端方法,使大型语言模型能够执行层次分析法工作流,从而提高多准则决策任务的透明度和与专家判断的一致性。

0 人收藏 0 人点赞
#interpretability

层重要性揭示了Transformer与状态空间模型中的什么?

arXiv cs.LG · 2026-09-16 缓存

本文将层重要性分解为必要性与可塑性,以此比较Transformer与状态空间模型,揭示二者内部动态的根本差异,并探讨其对微调与适应性调整的启示。

0 人收藏 0 人点赞
#interpretability

注意力平均场预测平均表征动态并揭示上下文特定计算

arXiv cs.LG · 2026-09-16 缓存

本文介绍了一种注意力的平均场分析,该分析能够预测平均表征动态并揭示语言模型中的上下文特定计算,并在GPT-2、Pythia和Qwen-3-14B等模型上进行了验证。

0 人收藏 0 人点赞
#interpretability

通过稀疏自编码器的测试时遗忘

arXiv cs.LG · 2026-09-16 缓存

ARIA是一种用于大型语言模型的测试时遗忘方法,它使用稀疏自编码器在推理过程中抑制不需要的知识,而不修改权重,从而改善遗忘-保留权衡,并在对抗性攻击中保持稳健。

0 人收藏 0 人点赞
#interpretability

Bypass Observation: 一种非侵入式层级语义提取架构的概念设计

arXiv cs.AI · 2026-09-15 缓存

本文提出Bypass Observation,一种非侵入式架构,用于从大型语言模型中提取中间语义信息,以提高可解释性和安全审计。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈