interpretability

标签

Cards List
#interpretability

看见还是知道?多模态大语言模型中的视觉上下文敏感性

Hugging Face Daily Papers · 2026-07-28 缓存

本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。

0 人收藏 0 人点赞
#interpretability

@SwissCognitive: Claude的J-space揭示了内部处理过程的线索,但它并非推理的可读转录,这是一个重要的限制…

X AI KOLs Timeline · 2026-07-27 缓存

Anthropic对Claude内部'J空间'的研究揭示了模型处理推理过程的线索,但它并非完整的可读转录,凸显了AI可解释性的关键局限性。

0 人收藏 0 人点赞
#interpretability

LatentFlow:分子图神经网络中潜在空间分析的可视化分析系统

arXiv cs.LG · 2026-07-27 缓存

LatentFlow是一个用于分析分子图神经网络中潜在空间的可视化分析系统,帮助科学家理解分子嵌入聚类如何随层和模型状态演变。

0 人收藏 0 人点赞
#interpretability

神经特征治理:扩展原子盛行度

arXiv cs.LG · 2026-07-27 缓存

本文介绍了Neural Atom Prevalence(NAP),一种用于结构化节点级模型选择的贝叶斯框架,该框架在神经网络中实现了高稀疏性、高准确性和不确定性量化。

0 人收藏 0 人点赞
#interpretability

分析语言模型中的自伤表征:一项跨架构研究

arXiv cs.CL · 2026-07-27 缓存

本文分析了大型语言模型内部如何表征自伤内容,发现自伤信息在最后几层结晶,且线性可分性与探针准确性并不一致。

0 人收藏 0 人点赞
#interpretability

使用自然语言自动编码器探测Qwen2.5-7B中的潜在哥伦比亚身份推断

arXiv cs.CL · 2026-07-27 缓存

本初步研究使用自然语言自动编码器来探测Qwen2.5-7B在处理哥伦比亚西班牙语和英语提示时是否内部表示哥伦比亚身份、社会经济地位或刻板印象相关信息,发现潜在推断在被口头表达之前存在的证据。

0 人收藏 0 人点赞
#interpretability

路由子空间:微调语言模型中评估与部署行为偏差的审计

arXiv cs.CL · 2026-07-24 缓存

本文研究了微调语言模型中评估行为与部署行为之间的不匹配。它引入了一种方法,通过定位并干预内部表示来缩小这一差距。

0 人收藏 0 人点赞
#interpretability

使用奇偶瓶颈层扩展可解释的Transformer

arXiv cs.LG · 2026-07-24 缓存

介绍了ParityTransformer,这是一种GPT-2规模的架构,具有深度奇偶瓶颈层,使中间表示在设计上即可解释,在无需传统宽瓶颈内存成本的情况下高效强制稀疏性,并在稀疏探测任务上展示了具有竞争力的性能。

0 人收藏 0 人点赞
#interpretability

单令牌稀疏自编码器特征是否具有因果必要性?层深度与SAE家族效应

arXiv cs.LG · 2026-07-24 缓存

本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。

0 人收藏 0 人点赞
#interpretability

递归何时成为算法?权重共享循环Transformer中的收敛选择

arXiv cs.LG · 2026-07-24 缓存

本文研究了权重共享的循环Transformer何时实现真正的算法,引入了预算定律,并展示了机制在不同训练预算间的可迁移性,对自适应计算和可解释性具有意义。

0 人收藏 0 人点赞
#interpretability

超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响

arXiv cs.AI · 2026-07-24 缓存

本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。

0 人收藏 0 人点赞
#interpretability

DecodeShare:追踪LLM解码时决策的共享子空间

arXiv cs.AI · 2026-07-24 缓存

DecodeShare提出了一种方法,用于识别LLM在解码时隐藏状态中跨任务一致共享的低维子空间,并表明干扰该子空间对决策性能的损害程度超过同等待遇下干扰随机或预填充派生的子空间,这对激活引导具有启示意义。

0 人收藏 0 人点赞
#interpretability

@GoodfireAI:3个月前,我们利用可解释性预测了420万个基因变异中哪些会导致疾病。现在,我们已经验证…

X AI KOLs Timeline · 2026-07-23 缓存

GoodfireAI利用可解释性预测哪些基因变异会导致疾病,用真实世界数据验证了预测结果,并发布了涵盖NIH的ClinVar数据库中所有变体的开源数据库。

0 人收藏 0 人点赞
#interpretability

CASE: 因果对齐与结构强化以提升思维链忠实性

arXiv cs.CL · 2026-07-22 缓存

提出了CASE,一个结合训练时因果对齐与推理时结构强化的框架,旨在提升大语言模型思维链推理的忠实性,在多个基准测试中平均实现了37%的思维链忠实性提升。

0 人收藏 0 人点赞
#interpretability

为什么?解读模型对因果关系与对立关系的编码

arXiv cs.CL · 2026-07-22 缓存

本文研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何通过可解释性技术,在下一个词元预测任务中编码因果关系与对立关系的话语关系。

0 人收藏 0 人点赞
#interpretability

语义基元作为大型语言模型中情感的解释项

arXiv cs.AI · 2026-07-22 缓存

本文提出使用自然语义元语言(NSM)基元作为对大型语言模型中情感更基础的解释,展示其可恢复、因果可控且忠实,优于基于评估的定向方法。

0 人收藏 0 人点赞
#interpretability

面向关键系统的可信代理型人工智能工程

arXiv cs.AI · 2026-07-22 缓存

本综述针对关键工程系统中的代理型AI提出了一个可信模型,涵盖了安全、鲁棒性、透明性、可问责性和安全性,涉及电力系统、自动驾驶车辆等领域。

0 人收藏 0 人点赞
#interpretability

循环语言模型中的操作原型自省:过程质量探针、可执行分支与读出控制边界

arXiv cs.LG · 2026-07-22 缓存

本文研究了一个冻结的循环变换器能否读取自身计算质量(预答案预测达到AUROC 0.797)以及外部干预能否改善结果,发现所有测试的冻结干预均未产生验证的能力增益,这一特性称为操作原型自省。

0 人收藏 0 人点赞
#interpretability

AHEAD: 通过可解释的跨标注者建模推进多类标签聚合

arXiv cs.LG · 2026-07-22 缓存

本文提出了AHEAD,一种用于多类标签聚合的跨标注者学习框架,该框架使用图神经网络对标注者可靠性进行建模,在涵盖NLP、CV、视频和音频的10个真实世界数据集上实现了显著的准确性提升。

0 人收藏 0 人点赞
#interpretability

面向可信赖大语言模型推理的概率概念感知引导

arXiv cs.AI · 2026-07-22 缓存

本文介绍了面向大语言模型推理的概率概念感知引导(PCS)框架,该框架利用概念驱动的引导向量检索和概率强度校准,提升了可解释性、最优性和泛化能力,在多个数据集上实现了方向准确率提高超过30%,引导准确率超过89%。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈