internal-states

标签

Cards List
#internal-states

@rohanpaul_ai: 你可以预测LLM的内部状态走向,并且有针对性的编辑可以将其拉回正轨。在冻结的……

X AI KOLs Following ↗ · 15小时前 缓存

研究表明,从LLM隐藏状态中提取的一小组内部坐标可以预测未来状态并实现有针对性的编辑,与基线相比,预测误差降低了69-76%。

0 人收藏 0 人点赞
#internal-states

我要求Claude展示其内部思维机制。基于Opus 5.5构建

Reddit r/singularity ↗ · 6天前

一篇文章描述了一项实验,作者要求Claude(一个由Opus 5.5构建的AI模型)揭示其内部工作机制的洞见。

0 人收藏 0 人点赞
#internal-states

痛苦轴心:大语言模型表征自我导向伤害并采取行动缓解

arXiv cs.AI ↗ · 2026-09-16 缓存

本研究探讨大语言模型是否具有独特的疼痛内部表征,发现它们确实有,并通过实验检验其功能性后果,最终得出对AI安全和福利的启示。

0 人收藏 0 人点赞
#internal-states

@rohanpaul_ai: 非常有趣的工作——语言模型不仅会在输出表面产生不良结果;它们还会经历内部状态…

X AI KOLs Timeline ↗ · 2026-07-05 缓存

讨论了一项研究,表明语言模型会展现出内部状态,这些状态携带了不确定性、策略性扭曲或不当服从的痕迹,而不仅仅是产生不良输出。

0 人收藏 0 人点赞
#internal-states

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

arXiv cs.CL ↗ · 2026-06-29 缓存

本文对大语言模型中基于探针的不确定性估计进行了分解研究,表明原始隐藏状态和注意力特征在域内表现良好,但结构化特征在分布偏移下更为鲁棒,并提供了预训练探针作为现成基线。

0 人收藏 0 人点赞
#internal-states

你的语言模型就是其自身的评论者:利用演员内部状态进行价值估计的强化学习

Hugging Face Daily Papers ↗ · 2026-05-08 缓存

本文介绍了 POISE,一种通过利用模型自身内部状态来估计基线,从而在大型推理模型中实现稳定策略优化的方法,与 PPO 和 GRPO 相比,该方法降低了计算开销。

0 人收藏 0 人点赞
#internal-states

大语言模型真的知道自己不知道什么吗?内部状态主要反映知识回忆而非真实性

arXiv cs.CL ↗ · 2026-04-20 缓存

本文质疑了大语言模型能够通过内部信号可靠区分幻觉输出和事实输出的假设,论证内部状态主要反映知识回忆而非真实性。作者提出了一套幻觉分类法(相关性幻觉与非相关性幻觉),并证明相关性幻觉的隐藏状态几何特性与事实输出重叠,使得标准检测方法失效。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈