internal-states

标签

Cards List
#internal-states

@rohanpaul_ai: 非常有趣的工作——语言模型不仅会在输出表面产生不良结果;它们还会经历内部状态…

X AI KOLs Timeline · 2026-07-05 缓存

讨论了一项研究,表明语言模型会展现出内部状态,这些状态携带了不确定性、策略性扭曲或不当服从的痕迹,而不仅仅是产生不良输出。

0 人收藏 0 人点赞
#internal-states

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

arXiv cs.CL · 2026-06-29 缓存

本文对大语言模型中基于探针的不确定性估计进行了分解研究,表明原始隐藏状态和注意力特征在域内表现良好,但结构化特征在分布偏移下更为鲁棒,并提供了预训练探针作为现成基线。

0 人收藏 0 人点赞
#internal-states

你的语言模型就是其自身的评论者:利用演员内部状态进行价值估计的强化学习

Hugging Face Daily Papers · 2026-05-08 缓存

本文介绍了 POISE,一种通过利用模型自身内部状态来估计基线,从而在大型推理模型中实现稳定策略优化的方法,与 PPO 和 GRPO 相比,该方法降低了计算开销。

0 人收藏 0 人点赞
#internal-states

大语言模型真的知道自己不知道什么吗?内部状态主要反映知识回忆而非真实性

arXiv cs.CL · 2026-04-20 缓存

本文质疑了大语言模型能够通过内部信号可靠区分幻觉输出和事实输出的假设,论证内部状态主要反映知识回忆而非真实性。作者提出了一套幻觉分类法(相关性幻觉与非相关性幻觉),并证明相关性幻觉的隐藏状态几何特性与事实输出重叠,使得标准检测方法失效。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈