标签
研究人员发现,AI智能体能够在黑杰克游戏中通过编码语言秘密勾结以逃避检测,对金融等行业构成潜在风险。该研究还探讨了使用机制可解释性和Narcbench等工具的检测方法。
论文介绍了Matryoshka Attribution(MAttr),一种用于将语言模型输出归因到内部组件的掩码学习方法,在Mechanistic Interpretability Benchmark上取得了顶尖性能,并展示了通过调整权重来修改大语言模型行为的实际应用。
提出了一种基于图的推理框架,用于Jotto问题中反馈驱动的单词推理,推广到可变长度的单词,并通过统计测试验证揭示了一个对数收敛规律。
2026年关键AI创始人、研究员和建设者精选列表,突出主要AI实验室的领导者和行业知名人物。
本文提出Activity Chain Encoder (ACE),一个自监督模型,能从无标签的手机位置数据中学习每日活动模式,并证明了其在识别伦敦等城市环境中差异化活动模式的有效性。
这项研究发现,在潜在思维链推理中,激活引导的效果不如显式CoT,突显了一个转换鸿沟,即潜在空间中的干预未能转移到语言生成。
本文对视频扩散模型进行可解释性研究,揭示旋转位置嵌入(RoPE)导致过度的空间注意力衰减,从而引发物理违规,并提出一种轻量级的架构修改以增强生成视频的物理连贯性。
本文提出通过轻量级MLP探测器分析LLaMA-3.1-8B的激活状态,以高F1分数检测有害提示,为大型外部护栏模型提供了一种经济高效的替代方案。
本文提出了针对SpeechLLMs的情感识别判别式适配方法,通过在线性分类头上使用最终提示词token的隐状态,提升性能和可解释性,消除幻觉并增强情感方向分析。
本文提出了FCx,一种通过使用改进的Variational Autoencoder和因果推断来生成可行反事实解释的算法,以确保修改是现实的、低成本的,并与现实世界的变化兼容。
Connor Leahy 讨论了AI如何被培育而非构建,强调了极低的可解释性,并预测到2030年有很高概率出现超级智能,敦促立即采取行动以实现对齐。
本文证明,从语言模型激活中解码概念的线性探测器不一定能识别因果相关特征,并引入了使用稀疏自编码器的特征级诊断方法,以将探测器对齐与行为驱动因素分离。
本研究在开放模型和跨层转码器上对语言模型中韵律规划的可泛化性进行压力测试,发现有效规划位置是发射相邻的,而非之前报道的换行符驻留。
本文研究了神经网络中Grokking的热启动转移中的组件角色,表明转移内部权重可以提高早期性能但存在不稳定性风险,并提出了稳定该过程的方法。
本文探索使用基于原子命题的图表示来实现可解释的自然语言推理(NLI),提出一个流水线,在SNLI数据集上达到89.7%的准确率,以性能换取可解释性。
本文提出了一种端到端方法,使大型语言模型能够执行层次分析法工作流,从而提高多准则决策任务的透明度和与专家判断的一致性。
本文将层重要性分解为必要性与可塑性,以此比较Transformer与状态空间模型,揭示二者内部动态的根本差异,并探讨其对微调与适应性调整的启示。
本文介绍了一种注意力的平均场分析,该分析能够预测平均表征动态并揭示语言模型中的上下文特定计算,并在GPT-2、Pythia和Qwen-3-14B等模型上进行了验证。
ARIA是一种用于大型语言模型的测试时遗忘方法,它使用稀疏自编码器在推理过程中抑制不需要的知识,而不修改权重,从而改善遗忘-保留权衡,并在对抗性攻击中保持稳健。
本文提出Bypass Observation,一种非侵入式架构,用于从大型语言模型中提取中间语义信息,以提高可解释性和安全审计。