hidden-states

标签

Cards List
#hidden-states

语言模型隐藏状态中的轨迹动态预测人类处理成本超越惊讶度

arXiv cs.CL · 2026-06-05 缓存

介绍轨迹外推误差,这是一种从变换器语言模型隐藏状态导出的度量,它独立于惊讶度且与其正交地预测人类阅读时间,揭示了增量处理成本中一个可分离的成分。

0 人收藏 0 人点赞
#hidden-states

幻觉可从量化大语言模型中间层隐藏状态线性解码

arXiv cs.LG · 2026-06-03 缓存

本文研究开源量化大语言模型的隐藏状态中是否编码了线性可分的真实性信号。在三个7B-8B指令调优模型上,对单个网络中间层的线性探针在幻觉检测基准上达到0.904-1.000 AUROC,优于基于采样的方法。

0 人收藏 0 人点赞
#hidden-states

线性探针在语言模型隐藏状态中检测的是任务格式,而非推理模式

arXiv cs.CL · 2026-06-03 缓存

本文证明,基于LLM隐藏状态的线性探针检测到的是任务格式混淆因素(例如来源身份、回答长度),而非不同的推理模式。通过残差化和因果引导,表明高探针准确率源于表面特征,而非计算结构。

0 人收藏 0 人点赞
#hidden-states

通过探针目标微调,让LLM真正表达其自信程度。[研究]

Reddit r/MachineLearning · 2026-05-29

这项研究提出了探针目标微调(LoRA)方法,使LLM能够口头表达其内部置信度,实现了对置信度输出的因果控制,并证明模型通常知道自己是正确还是错误,但未能表达出来。

0 人收藏 0 人点赞
#hidden-states

ARBITER: 推理轨迹盆地与测试时采样中的多数投票失败

arXiv cs.LG · 2026-05-27 缓存

本文发现,语言模型在测试时采样中的推理轨迹会聚集成‘推理盆地’,当主导盆地错误时,会导致多数投票失败。本文提出了ARBITER,一种与模型无关的方法,利用模型自身输出和隐藏状态中的保守加性证据,无需外部数据即可提高准确性。

0 人收藏 0 人点赞
#hidden-states

视觉-语言模型中可靠性的所在:注意力、隐藏状态与因果电路的机制研究

arXiv cs.AI · 2026-05-12 缓存

本文通过证明注意力图的尖锐度并非视觉-语言模型正确性的良好预测指标,挑战了“注意力-置信度假设”。相反,研究表明,隐藏状态的几何特征和自一致性更能反映模型的可靠性,并揭示了晚期融合模型与早期融合模型在架构上的显著差异。

0 人收藏 0 人点赞
#hidden-states

LLM代理已经知道何时调用工具——甚至无需推理

Hugging Face Daily Papers · 2026-05-10 缓存

本文介绍了When2Tool,一个研究LLM代理实际何时需要调用工具的基准,并揭示模型已从隐藏状态知道工具的必要性但未能采取行动。提出的Probe&Prefill方法将不必要的工具调用减少了48%,且精度损失极小。

0 人收藏 0 人点赞
#hidden-states

@rohanpaul_ai: 冻结的LLM在其隐藏状态深处仍携带可读的行为信号。Proprioceptive AI已创建了Cy…

X AI KOLs Following · 2026-05-07

Proprioceptive AI发布了Cygnus,这是一款为冻结的LLM配备自感知适配器的工具,通过gl(4,R)李代数读取内部隐藏状态以隔离暗模式,将Qwen-32B在ARC-Challenge上的分数从82.2%提升到94.97%,仅使用一张RTX 3090且无需重新训练。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈