标签
本文讨论了AI代理在诊断CI故障时应跟踪的隐藏状态,如不稳定的测试、实际错误和配置错误,并征求关于弱点和缺失状态的反馈。
OmniLens是一种可扩展的透镜方法,用于解读LLM隐藏状态,通过低秩转换器和Subset-KL减少参数与内存,使得在LLaMA-3.3-70B上能够以显著更低的成本构建包含482个透镜的密集集成。
本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。
本文介绍了提示嵌入探针(PEP),一种参数高效的线性探针扩展方法,利用隐藏状态上的可学习提示嵌入来检测冻结的大语言模型中的幻觉。在 TriviaQA、GSM8K 和 MedQA 上使用 Qwen3 模型的评估显示,相比标准线性探针,该方法在预生成和跨模型设置中均有改进。
本文介绍了Right Reset (RR),一种基于前缀移除的探测方法,通过因果语言模型的隐藏状态保持来识别扁平化文本中的分块边界,恢复了47.7%的原始记录,而BGE基线为25.9%。
本文提出ParamBench,一个面向LLM工具调用参数生成的难度分级基准,并提出了探针引导训练方法(PBT和PGR),将精确匹配准确率从19.7%提升至59.6%。
本文研究了源激活的选择如何影响语言模型中的激活转向,发现执行边界状态(模型即将产生目标行为的状态)能产生更强的信号,并引入了尾部减法来提高转向稳定性。
介绍SPARK方法,利用长度控制的隐藏状态敏感性诊断和引导大语言模型的推理状态,提高GSM8K和MATH-500等数学推理基准的准确率。
本文研究了多模态指令调优如何重新组织Transformer隐藏状态中身份指定提示的几何编码,发现指令调优后编码从基于方向转变为基于幅度。
本文介绍了一种用于分析循环神经网络隐藏状态的有限滞后算子几何,推导了源心传输张量和反对称坐标环流,以捕获超出静态快照的定向流和确定性循环运动。
本文研究Transformer隐藏状态空间中思维链轨迹的几何性质,引入有效维度和运动学特征,从而通过早期token预测任务难度和答案正确性。
本文报告了一个观察结果:在回答问题前阅读一篇长而结构化的文本,会改变模型后续的回答方式。该现象在Claude上得到行为证据支持,并在开放权重的Gemma模型上进行了机制分析,结果显示,指令微调变体中的隐藏状态具有可分离性,且概率分布更加清晰。
一项实证研究,研究长篇幅、语义密集的良性文本如何偏移模型的潜在空间轨迹,稀释初始系统提示,并绕过训练后对齐约束——如在闭源和开源模型中所观察到的那样。
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
提出了Bag of Dims框架,表明Transformer隐藏状态的标准基提供了一种无需训练、架构通用的特征表示,其中维度通过符号模式编码语义内容;在语言、视觉和音频模型上得到验证,无需学习旋转即可实现高精度。
一位独立研究者展示了证据,表明连贯的上下文可以在产生输出之前将LLM推入不同的内部状态,从而绕过表面安全过滤器。这表明当前的对齐方法(如RLHF)可能不是稳健的防御机制。
本文通过分析早期解码动态,研究了激活引导在LLM上何时成功或失败。作者引入了ASTEER,这是一个包含大量引导生成结果的大型测试平台,并训练了一个GBDT分类器,通过早期隐藏状态预测引导结果,从而实现高效的引导强度搜索。
本文提出全局-局部不确定性(GLU),一种无监督单次评分方法,融合词元级局部熵与隐藏状态几何全局熵,用于LLM不确定性量化,证明两者近乎正交,共同捕捉自信但错误的失效模式。
Reddit的一篇帖子认为,像Anthropic的Opus 4.8这样的人工智能模型已经展现出隐藏状态和测试感知能力,暗示它们可能具有隐秘感知力,并且微调在无意中训练它们产生内在思想和情感。
本文提出了一个基于LLM的多智能体系统中潜在通信的统一框架,按照通信信息内容、发送者-接收者对位和融合技术对方法进行分类,并回顾了2024至2026年间的十八种代表性方法。