标签
研究表明,从LLM隐藏状态中提取的一小组内部坐标可以预测未来状态并实现有针对性的编辑,与基线相比,预测误差降低了69-76%。
一篇文章描述了一项实验,作者要求Claude(一个由Opus 5.5构建的AI模型)揭示其内部工作机制的洞见。
本研究探讨大语言模型是否具有独特的疼痛内部表征,发现它们确实有,并通过实验检验其功能性后果,最终得出对AI安全和福利的启示。
讨论了一项研究,表明语言模型会展现出内部状态,这些状态携带了不确定性、策略性扭曲或不当服从的痕迹,而不仅仅是产生不良输出。
本文对大语言模型中基于探针的不确定性估计进行了分解研究,表明原始隐藏状态和注意力特征在域内表现良好,但结构化特征在分布偏移下更为鲁棒,并提供了预训练探针作为现成基线。
本文介绍了 POISE,一种通过利用模型自身内部状态来估计基线,从而在大型推理模型中实现稳定策略优化的方法,与 PPO 和 GRPO 相比,该方法降低了计算开销。
本文质疑了大语言模型能够通过内部信号可靠区分幻觉输出和事实输出的假设,论证内部状态主要反映知识回忆而非真实性。作者提出了一套幻觉分类法(相关性幻觉与非相关性幻觉),并证明相关性幻觉的隐藏状态几何特性与事实输出重叠,使得标准检测方法失效。