标签
该论文提出了 PAIR(Phase-Aligned Intra-question Reasoning,相位对齐的题内推理),将 LLM 的推理路径视为相位结构化的轨迹,并且只在同一道问题内部评估路径质量。研究发现,标准的正确性探测在一定程度上依赖于题目层面的差异,而逐相位的引导能够提供关于路径质量方向的因果证据。
研究表明,从LLM隐藏状态中提取的一小组内部坐标可以预测未来状态并实现有针对性的编辑,与基线相比,预测误差降低了69-76%。
本研究探究了基于单语数据训练的幻觉检测探针在Hinglish上的迁移效果,结果显示检测性能稳健,且Hindi和Hinglish中的幻觉率高于英语。
本文提出Bypass Observation,一种非侵入式架构,用于从大型语言模型中提取中间语义信息,以提高可解释性和安全审计。
ForeSight是一个框架,通过分析第一个令牌的隐藏状态来预测大型语言模型的有害输出,提高早期风险监控效率。
本文提出了一种基于参考的隐藏状态审计方法,以最小计算量检测LLM中的偏差偏移,显示与基准测试中输出级偏差变化的高相关性。
本文讨论了AI代理在诊断CI故障时应跟踪的隐藏状态,如不稳定的测试、实际错误和配置错误,并征求关于弱点和缺失状态的反馈。
OmniLens是一种可扩展的透镜方法,用于解读LLM隐藏状态,通过低秩转换器和Subset-KL减少参数与内存,使得在LLaMA-3.3-70B上能够以显著更低的成本构建包含482个透镜的密集集成。
本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。
本文介绍了提示嵌入探针(PEP),一种参数高效的线性探针扩展方法,利用隐藏状态上的可学习提示嵌入来检测冻结的大语言模型中的幻觉。在 TriviaQA、GSM8K 和 MedQA 上使用 Qwen3 模型的评估显示,相比标准线性探针,该方法在预生成和跨模型设置中均有改进。
本文介绍了Right Reset (RR),一种基于前缀移除的探测方法,通过因果语言模型的隐藏状态保持来识别扁平化文本中的分块边界,恢复了47.7%的原始记录,而BGE基线为25.9%。
本文提出ParamBench,一个面向LLM工具调用参数生成的难度分级基准,并提出了探针引导训练方法(PBT和PGR),将精确匹配准确率从19.7%提升至59.6%。
本文研究了源激活的选择如何影响语言模型中的激活转向,发现执行边界状态(模型即将产生目标行为的状态)能产生更强的信号,并引入了尾部减法来提高转向稳定性。
介绍SPARK方法,利用长度控制的隐藏状态敏感性诊断和引导大语言模型的推理状态,提高GSM8K和MATH-500等数学推理基准的准确率。
本文研究了多模态指令调优如何重新组织Transformer隐藏状态中身份指定提示的几何编码,发现指令调优后编码从基于方向转变为基于幅度。
本文介绍了一种用于分析循环神经网络隐藏状态的有限滞后算子几何,推导了源心传输张量和反对称坐标环流,以捕获超出静态快照的定向流和确定性循环运动。
本文研究Transformer隐藏状态空间中思维链轨迹的几何性质,引入有效维度和运动学特征,从而通过早期token预测任务难度和答案正确性。
本文报告了一个观察结果:在回答问题前阅读一篇长而结构化的文本,会改变模型后续的回答方式。该现象在Claude上得到行为证据支持,并在开放权重的Gemma模型上进行了机制分析,结果显示,指令微调变体中的隐藏状态具有可分离性,且概率分布更加清晰。
一项实证研究,研究长篇幅、语义密集的良性文本如何偏移模型的潜在空间轨迹,稀释初始系统提示,并绕过训练后对齐约束——如在闭源和开源模型中所观察到的那样。
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。