标签
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
Anthropic对Claude内部'J空间'的研究揭示了模型处理推理过程的线索,但它并非完整的可读转录,凸显了AI可解释性的关键局限性。
LatentFlow是一个用于分析分子图神经网络中潜在空间的可视化分析系统,帮助科学家理解分子嵌入聚类如何随层和模型状态演变。
本文介绍了Neural Atom Prevalence(NAP),一种用于结构化节点级模型选择的贝叶斯框架,该框架在神经网络中实现了高稀疏性、高准确性和不确定性量化。
本文分析了大型语言模型内部如何表征自伤内容,发现自伤信息在最后几层结晶,且线性可分性与探针准确性并不一致。
本初步研究使用自然语言自动编码器来探测Qwen2.5-7B在处理哥伦比亚西班牙语和英语提示时是否内部表示哥伦比亚身份、社会经济地位或刻板印象相关信息,发现潜在推断在被口头表达之前存在的证据。
本文研究了微调语言模型中评估行为与部署行为之间的不匹配。它引入了一种方法,通过定位并干预内部表示来缩小这一差距。
介绍了ParityTransformer,这是一种GPT-2规模的架构,具有深度奇偶瓶颈层,使中间表示在设计上即可解释,在无需传统宽瓶颈内存成本的情况下高效强制稀疏性,并在稀疏探测任务上展示了具有竞争力的性能。
本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。
本文研究了权重共享的循环Transformer何时实现真正的算法,引入了预算定律,并展示了机制在不同训练预算间的可迁移性,对自适应计算和可解释性具有意义。
本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。
DecodeShare提出了一种方法,用于识别LLM在解码时隐藏状态中跨任务一致共享的低维子空间,并表明干扰该子空间对决策性能的损害程度超过同等待遇下干扰随机或预填充派生的子空间,这对激活引导具有启示意义。
GoodfireAI利用可解释性预测哪些基因变异会导致疾病,用真实世界数据验证了预测结果,并发布了涵盖NIH的ClinVar数据库中所有变体的开源数据库。
提出了CASE,一个结合训练时因果对齐与推理时结构强化的框架,旨在提升大语言模型思维链推理的忠实性,在多个基准测试中平均实现了37%的思维链忠实性提升。
本文研究了经过指令微调的Transformer模型(LLaMA和Mistral)如何通过可解释性技术,在下一个词元预测任务中编码因果关系与对立关系的话语关系。
本文提出使用自然语义元语言(NSM)基元作为对大型语言模型中情感更基础的解释,展示其可恢复、因果可控且忠实,优于基于评估的定向方法。
本综述针对关键工程系统中的代理型AI提出了一个可信模型,涵盖了安全、鲁棒性、透明性、可问责性和安全性,涉及电力系统、自动驾驶车辆等领域。
本文研究了一个冻结的循环变换器能否读取自身计算质量(预答案预测达到AUROC 0.797)以及外部干预能否改善结果,发现所有测试的冻结干预均未产生验证的能力增益,这一特性称为操作原型自省。
本文提出了AHEAD,一种用于多类标签聚合的跨标注者学习框架,该框架使用图神经网络对标注者可靠性进行建模,在涵盖NLP、CV、视频和音频的10个真实世界数据集上实现了显著的准确性提升。
本文介绍了面向大语言模型推理的概率概念感知引导(PCS)框架,该框架利用概念驱动的引导向量检索和概率强度校准,提升了可解释性、最优性和泛化能力,在多个数据集上实现了方向准确率提高超过30%,引导准确率超过89%。