标签
本文通过测量因果深度和多token混淆,研究语言模型中的潜在学习,以理解特质如何通过看似无关的输出进行传递。
本文分析了像Moshi和PersonaPlex这样的全双工语音LLMs中的虚假起始问题,并介绍了一种基于因果分析的推理时缓解方法,无需重新训练即可抑制这些问题。
本文提出了一种因果分析框架,用于识别时间序列基础模型中的偏差,并应用于 Chronos-2 和 TimesFM-2.5,揭示了特定的失败模式,如对持续性的过度估计以及对 regime switch 模式的失败。
本文提出了AI模型中亚特征传递的两阶段机制,其中优化器状态传输源扰动,后续训练决定其行为价值。
本文介绍了AgenticRAG-FP,一个用于智能体RAG系统中因果故障归因的干预基准,分析了故障如何在检索跳数间传播,并评估了诊断性能。
本文使用执行重放的因果真值来审计LLM代理中的步骤级信用分配,发现常见的信用信号在识别因果重要步骤方面未能优于随机水平,这对训练方法具有启示意义。
本文研究了混合专家模型中 4-bit KV 缓存量化如何导致路由翻转,发现检测翻转是可能的,但预测翻转是否有害却不可行,并提出了一种因果测量装置而非缓解措施。
本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。
本文研究了扩散变换器(DiTs)中的文本模板令牌如何作为隐式语义寄存器,在去噪过程中因果地维持物体身份,并提出了一种无需训练的剪枝规则,该规则移除了20%的注意力FLOPs,且性能下降极小。
本文分析了隐式推理模型(LRM),并论证隐状态中的可观测模式并非推理的因果解释;它倡导在可解释性研究中采用匹配对照和因果测试。
ORCA 是一款端到端因果分析的副驾驶,利用代理引导用户完成包括因果发现、效应估计和根本原因分析在内的工作流,并生成结构化报告。
本文提出了一种用于Transformer语言模型中因果特征分析的五阶段方法论,并在GPT-2 small上针对IOI任务进行了演示。研究发现特征具有特定的因果性但并非必要,并揭示了检测鲁棒性与因果鲁棒性之间的差距。
本文识别了多模块LLM代理中的'诊断悖论':对于失败因果性责任最大的模块(路由模块)并非最佳干预点,修补该模块反而可能损害性能。作者提出'语言契约'假说,并在三个代理系列中展示了实证证据。
本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。
本文提供因果证据表明自回归语言模型中的幻觉源于由非对称吸引子动力学驱动的早期轨迹承诺。通过在Qwen2.5-1.5B上进行同提示分叉和激活补丁实验,证明幻觉轨迹在首个token处分叉,并在模型各层间展现强烈的因果非对称性。