probing

标签

Cards List
#probing

Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

arXiv cs.LG · 3天前 缓存

This paper proposes a three-stream detector that combines residual-stream motion with coarse regions and fine directions to better identify reasoning errors in LLMs, improving selection accuracy by up to 12% over state-of-the-art displacement-only methods.

0 人收藏 0 人点赞
#probing

Right Reset:通过前缀移除进行分块

arXiv cs.CL · 4天前 缓存

本文介绍了Right Reset (RR),一种基于前缀移除的探测方法,通过因果语言模型的隐藏状态保持来识别扁平化文本中的分块边界,恢复了47.7%的原始记录,而BGE基线为25.9%。

0 人收藏 0 人点赞
#probing

当多反而少:语言模型中位置相关的重复效应

arXiv cs.CL · 4天前 缓存

本文表明,语言模型中的重复效应取决于读取位置:相邻重复会提高目标概率,而移位重复则产生倒U形曲线。这一发现挑战了完形填空式探测中的假设,并在多个模型和语言中得到了验证。

0 人收藏 0 人点赞
#probing

Probing Character-level Transformers for the Spanish L-shaped Morphome

arXiv cs.CL · 5天前 缓存

This paper probes character-level transformers to investigate whether they encode the Spanish L-shaped morphome, an irregular morphological pattern, as an abstract class or just surface alternations. The authors find that the encoding is item-specific and localized, but does not generalize like human learners.

0 人收藏 0 人点赞
#probing

语言模型编码命题的语境真实性

arXiv cs.CL · 5天前 缓存

本文研究了大语言模型(LLMs)如何将情境真值——即真值取决于上下文证据的命题——编码为激活空间中的线性方向,表明这些表征在不同输出策略下持续存在,并可通过对话方的断言而发生偏移,相关证据将表征偏移与谄媚行为联系起来。

0 人收藏 0 人点赞
#probing

循环语言模型中的操作原型自省:过程质量探针、可执行分支与读出控制边界

arXiv cs.LG · 2026-07-22 缓存

本文研究了一个冻结的循环变换器能否读取自身计算质量(预答案预测达到AUROC 0.797)以及外部干预能否改善结果,发现所有测试的冻结干预均未产生验证的能力增益,这一特性称为操作原型自省。

0 人收藏 0 人点赞
#probing

奖励何时教导状态?一种隐藏自动机仪器与群体语言边界

arXiv cs.LG · 2026-07-15 缓存

本文介绍了一种白盒仪器,使用隐藏确定性有限自动机分别测量强化学习代理的奖励成功和潜在状态学习,发现高奖励并不意味着任务理解。

0 人收藏 0 人点赞
#probing

编码智能体提前思考

Hacker News Top · 2026-07-14 缓存

本文研究了编码智能体中的语言模型如何在迭代编辑过程中内部表示不断演变的程序。作者发现,线性探针可以从残差流中解码程序属性(例如解析、测试通过率),并且令人惊讶的是,这些表示在代理实际进行编辑之前就能预测未来结果,揭示了一个“潜在编程视野”。

0 人收藏 0 人点赞
#probing

TypeProbe: 从预训练代码模型的隐藏状态中恢复类型表示

arXiv cs.CL · 2026-07-10 缓存

本文探究预训练代码模型是否在其隐藏状态中编码了类型信息,通过对Java和Python示例使用线性探针进行研究。结果表明,即使是从无类型代码中也会出现跨语言的类型表示,并且这些表示对词汇扰动和句法变化具有鲁棒性。

0 人收藏 0 人点赞
#probing

LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性

arXiv cs.CL · 2026-07-10 缓存

本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。

0 人收藏 0 人点赞
#probing

Bielik 知道它不知道什么吗?激活分散性在模型规模上区分实体熟悉度与事实可靠性

arXiv cs.CL · 2026-07-09 缓存

本文研究了波兰 Bielik 大语言模型中的激活模式是否能在生成前检测到实体熟悉度,使用了无监督的分散度量,在模型规模上实现了已知实体与虚构实体的近乎完美分离,同时表明事实可靠性随规模急剧提升,但更难从激活中预测。

0 人收藏 0 人点赞
#probing

从一开始就注定失败:通过召回控制探针级联提前终止LLM代理任务轮次

arXiv cs.AI · 2026-07-08 缓存

本文提出了一种召回控制的中止级联方法,通过在LLM代理的内部表示上使用轻量级探针,早期检测并中止注定失败的任务轮次,在保持高召回率成功轮次的同时,最多可节省47%的推理计算量。

0 人收藏 0 人点赞
#probing

探针而非提示:Multi-Meta-RAG 中基于隐藏状态的元数据过滤探针

arXiv cs.CL · 2026-07-07 缓存

本文提出用一个小型开源模型的隐藏状态训练的轻量级确定性探针替代 Multi-Meta-RAG 中专有的 GPT-3.5 元数据提取器。该探针达到 90.9% 的准确率,优于 GPT-3.5(80.9%)和子串基线(88.0%),同时避免了允许列表漂移和 API 成本。

0 人收藏 0 人点赞
#probing

野外探测:无监督发音分析下自监督语音表示在普通话次方言中的案例研究

arXiv cs.CL · 2026-06-25 缓存

本文通过无监督发音探测进行案例研究,探讨自监督语音模型如何在普通话次方言中编码语音特征,发现唇音性等显著特征保持稳定,而更精细的频谱区别则表现出方言依赖的变化。

0 人收藏 0 人点赞
#probing

MemTrace:探究最终准确率在长期记忆中遗漏的内容

arXiv cs.AI · 2026-06-17 缓存

MemTrace 是一个基准,它在知识点层面评估 LLM 代理的记忆,探究事实在不同记忆年龄、问题类型和证据条件下的表现。它揭示出汇总的准确率掩盖了不同的失败模式,并且主要瓶颈是证据的使用而非检索。

0 人收藏 0 人点赞
#probing

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL · 2026-06-16 缓存

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。

0 人收藏 0 人点赞
#probing

当探测精度饱和时,脆弱性解析:LLM预训练分析的补充指标

arXiv cs.CL · 2026-06-11 缓存

本文引入了'脆弱性'这一探测精度的补充指标,它衡量导致探测精度崩溃的激活噪声水平,从而能够在精度饱和后分析LLM预训练过程中的表示演化。

0 人收藏 0 人点赞
#probing

不要让LLM说话,直接探测它(8分钟阅读)

TLDR AI · 2026-06-11 缓存

本文介绍了一种技术,该技术从LLM的最后一个提示标记处提取隐藏状态,无需文本生成即可进行分类,使用一个小型MLP读取模型的内部决策,从而实现快速且廉价的零样本分类器。

0 人收藏 0 人点赞
#probing

幻觉可从量化大语言模型中间层隐藏状态线性解码

arXiv cs.LG · 2026-06-03 缓存

本文研究开源量化大语言模型的隐藏状态中是否编码了线性可分的真实性信号。在三个7B-8B指令调优模型上,对单个网络中间层的线性探针在幻觉检测基准上达到0.904-1.000 AUROC,优于基于采样的方法。

0 人收藏 0 人点赞
#probing

何时与多久?时间推理中的读出-中介角度

arXiv cs.LG · 2026-05-29 缓存

本文引入读出-中介角度,证明线性探针可以从语言模型激活中解码出与模型实际因果计算正交的信息,从而削弱了基于探针的可解释性。该发现跨模型规模和系列得到复现,揭示出使用探针进行机制理解或安全监控的一个根本性失败模式。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈