明晰的失败:检测和修复上下文绑定错误

arXiv cs.LG 论文

摘要

本文介绍了语言模型中的'明晰的失败',即模型在隐藏状态中拥有正确信息但未能使用,并表明线性探针可以通过引导干预检测和修复此类失败。

arXiv:2609.11216v1 公告类型:新 摘要:一个错误的答案并不能显示模型是缺乏所需信息还是持有信息但未能使用。在实体-义务绑定任务上,语言模型可能会输出不正确的提示提供的绑定,而线性探针可以从其冻结的隐藏状态中恢复正确的绑定。我们测量了这种情况在16个公开检查点中的发生频率,每个检查点用三个种子评估。我们在训练折上拟合探针,在验证折上选择其层,并在 disjoint 测试折上报告结果。在每个模型错误的试验中,探针的准确性超过了严格的在场-义务基线,1/K = 0.125,提高了+0.196(95%置信区间[+0.101, +0.296],在模型间自举)。一个查询-实体反事实排除了令牌的存在性和最近性。一个基于探针输出不一致符号的分数比模型自身的置信度提高了失败检测+0.079 AUROC(95%置信区间[+0.036, +0.126])。原始探针置信度相对于模型置信度没有可测量的改善。将残差流引导向探针解码的绑定,在没有金标签的情况下,提高了所有八个测试模型的准确性,平均+0.168(95%置信区间[+0.066, +0.280])。近期研究报告探针检测到的错误对干预具有抗性,而我们发现上下文绑定是探针可操作的一个场景。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:32

# 可读性故障:检测与修复上下文绑定错误
来源:https://arxiv.org/html/2609.11216
Samrath Chadha 单位:Efficient Computation Inc\. 邮箱:[samrath@perseus\.so](mailto:)
Abhinav Hari 单位:Efficient Computation Inc\. 邮箱:[abhinav@perseus\.so](mailto:)

###### 摘要

错误答案无法表明模型是缺乏所需信息,还是拥有信息但未能使用。在实体-义务绑定任务中,语言模型可能输出错误的提示提供的绑定,而线性探针却能从其冻结的隐藏状态中恢复正确的绑定。我们在 16 个公开检查点上测量了这一现象发生的频率,每个检查点使用三个随机种子进行评估。我们在训练折上拟合探针,在验证折上选择其层,并在不相交的测试折上报告结果。在每个模型判断错误的试验中,探针准确率比严格的“存在-义务”基线1/K=0\.1251/K=0\.125高出 +0\.196(95% CI \[\+0\.101, +0\.296\],在模型间进行自助法估计)。一个查询实体的反事实实验排除了标记存在性和近期性的影响。基于探针与输出不一致符号构建的分数,在故障检测方面比模型自身的置信度提高了 +0\.079 AUROC(95% CI \[\+0\.036, +0\.126\])。原始探针置信度相比模型置信度没有可测量的提升。将残差流引导向探针解码的绑定方向,无需黄金标签,在所有测试的八个模型上将准确率平均提高了 +0\.168(95% CI \[\+0\.066, +0\.280\])。近期研究发现探针检测到的错误对干预具有抵抗力,而我们发现上下文绑定是探针可操作的一种场景。

## 1 引言

外部行为无法区分两种故障。模型回答错误可能是因为它完全缺乏查询绑定的表示,也可能是因为它在隐藏状态中持有该表示,却未用它来决定输出。我们称后者为*可读性故障*:即使模型输出了错误的标记,正确的提示提供的绑定仍然可以通过线性方法恢复。这两种故障需要不同的应对措施。第一种需要提供信息。第二种可能在推理时被检测和修复。本文测量了可读性故障发生的频率,探针-输出不一致是否能检测它们,以及模型的解码状态是否可用于改变输出。

我们在一个受控的上下文绑定任务中检验这些问题。Transformer 形成了将属性附加到实体的结构[5 (https://arxiv.org/html/2609.11216#bib.bib5)],但随着实体列表的增长,从这些结构中检索会变得不可靠[7 (https://arxiv.org/html/2609.11216#bib.bib7)]。每次试验声明 KK 个实体-义务对,插入一个干扰块,并查询一个实体。这些分配由提示提供,并在每次试验中独立重新采样,因此实体身份本身不包含其义务的任何信息。尽管[Cheang 等人 \[4\]](https://arxiv.org/html/2609.11216#bib.bib4)认为隐藏状态探针跟踪的是参数知识的回忆,但对于这些新采样的绑定,该解释不适用。

对于每个模型,我们在训练折上拟合探针,在验证折上选择读取层,并在不相交的测试折上报告结果。然后,我们评估探针在模型回答错误的试验上的准确率。在 16 个公开检查点中,每个使用三个种子评估,有 14 个达到了预定的故障数量下限。在这些模型中,探针在故障上的准确率比存在集合基线高出 +0\.196(95% CI \[\+0\.101, +0\.296\])。一个查询实体的反事实实验在固定声明及其顺序的同时改变查询的实体。探针遵循相应义务的平均优势为 +0\.371(95% CI \[\+0\.243, +0\.503\]),表明探针读取的是查询条件信号,而非词汇存在性或近期性。平均而言,在模型的故障中,请求的绑定仍然可以从隐藏状态中通过线性方法恢复。

接下来,我们基于探针-输出一致性构建一个故障检测分数,并将其与模型自身的置信度、预测熵和采样自一致性进行比较。带符号的分数在故障检测方面比模型置信度提高了 +0\.079 AUROC(95% CI \[\+0\.036, +0\.126\])。原始探针置信度没有增加可测量的改进,而预测熵仍具有竞争力。

最后,我们测试解码状态是否可用于改变输出。我们在验证层上,对从发出类别指向探针解码类别的残差流应用了一种转向干预,无需黄金标签。在所有测试的 8 个模型中,该干预将准确率平均提高了 +0\.168(95% CI \[\+0\.066, +0\.280\])。一个匹配范数的随机方向修复的试验较少,而一个黄金目标分支界定了最大改进。先前的研究发现探针检测到的错误对干预具有抵抗力[13 (https://arxiv.org/html/2609.11216#bib.bib13), 2 (https://arxiv.org/html/2609.11216#bib.bib2)],但上下文绑定是探针可操作的一种场景。

本文的范围有意限定于合成任务、单标记答案、需要对隐藏状态进行白盒访问以及使用冻结检查点。因此,我们将干预视为在此协议下对解码状态的因果检验。第7节(https://arxiv.org/html/2609.11216#S7)详细说明了这些限制。

## 2 实验设置

### 2\.1 绑定任务

每次试验从不相交的集合中无放回地采样 K=8K=8 个实体和 KK 个义务,将它们配对,并将这些对写成 `实体: 义务` 的声明形式。随后是一个由词汇表中均匀随机抽取的 D=64D=64 个标记 ID 组成的块,然后是查询 `对于实体 e_{j},任务是:`,其中 j 是均匀选择的。义务集合包含 25 个动作词,实体集合包含 47 个名词,每个模型都过滤至其分词器将其映射为单个标记的那些。实体和义务在每次试验中独立重新采样,因此查询实体的身份不包含与其绑定的义务的任何信息。

当最终查询位置上义务集合中的最大 logit 是 o_{j} 时,该试验视为正确。根据该规则,随机猜测的概率是集合大小的倒数,约为0\.040\.04。我们始终报告一个更严格的参考点,即命名上下文中实际存在的 KK 个义务之一的概率,1/K=0\.1251/K=0\.125。第3节(https://arxiv.org/html/2609.11216#S3)中的量都针对该更严格的数字评分,即使探针面临与模型相同的集合决策,导致保守的优势。

### 2\.2 探针与故障条件准确率

在每个层 l,我们在查询的最终位置标准化残差流,并在义务集合上拟合一个多项式逻辑回归探针。每次运行的 600 个试验被洗牌并分为三部分。探针在第一部分上拟合,层根据第二部分上的准确率选择,所有报告的数量都在剩余的 200 个试验上计算,这些试验未被任何拟合或选择步骤见过。在所选层上,探针在前两部分上重新拟合后再进行测试折报告。

层选择是可能引入数据泄露的步骤。一个模型有数十个候选层和数百个标记好的试验。在测试折上选择层会将报告的数字调整到报告的折上。验证选择的层位于深度的0\.49到0\.92之间,并且在 16 个模型中的 10 个上随种子变化,正如重新运行的选择步骤应该做的那样。

感兴趣的量是 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}:在模型输出错误的试验上的探针准确率。根据设计,模型在这些试验上的准确率为零,高于存在集合基线的探针准确率衡量了模型持有但未使用的绑定。

因为 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}的分母是模型自身的故障次数,准确的模型留下的试验很少,难以估计。在运行扫描之前,我们固定了至少 30 个预期错误测试试验,对应于在 p=0\.5p=0\.5 时二项标准误为0\.0910\.091。对于低于此阈值的模型,pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}未报告。检测改为使用所有 200 个测试试验上的 AUROC,并为每个模型报告。

### 2\.3 模型与统计分析

扫描涵盖了 16 个公开检查点,参数从 410M 到 14B:Pythia 阶梯、GPT-Neo、OPT、OLMo-2 和 OLMoE、Qwen2\.5 阶梯以及 DeepSeek-Coder,包括一个基础和指令调优对。附录A(https://arxiv.org/html/2609.11216#A1)列出了检查点和层数,附录F(https://arxiv.org/html/2609.11216#A6)列出了探针超参数和计算资源。所有测量都使用冻结的检查点,我们没有微调任何模型。检查点版本未锁定;因此针对移动默认分支的重新运行不需要逐位相同。

本文报告的所有区间都是 95% 自助区间。模型是泛化的单位。每个跨模型估计都是在模型上进行 20,00020\{,\}000 次重采样的自助法,在重采样前对一个模型的三个种子取平均,因此一个模型无论被测量多少次运行都只贡献一次。种子和试验是嵌套观察。形如“在 n 个中 k 个为阳性”的逐模型计数仅具描述性。

图1:错误输出保留了正确的绑定。(A) 一次试验:KK 个声明、一个干扰块和查询。模型发出一个义务,探针解码另一个。(B) 每个模型错误试验上的探针准确率 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong},探针在训练折上拟合,其层在验证折上选择,准确率在不相交的 200 个试验的测试折上报告。条形图跨三个种子。虚线是存在集合基线 1/K=0\.1251/K=0\.125。16 个模型中有两个低于 30 个试验的故障下限,用斜线标出;pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}未对它们报告。在报告 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}的 14 个模型中,高于基线的优势为 +0\.196(95% CI \[\+0\.101, +0\.296\],自助法在模型上聚类)。

## 3 错误输出保留了正确的绑定

### 3\.1 跨十六个检查点的故障条件探针准确率

在模型发出错误义务的试验上,线性探针从相同的冻结隐藏状态中恢复了正确的义务(图1 (https://arxiv.org/html/2609.11216#S2.F1))。在报告 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}的 14 个模型中,错误试验上的探针准确率比 1/K=0\.1251/K=0\.125 的存在集合基线高出 +0\.196(95% CI \[\+0\.101, +0\.296\],自助法在模型上聚类)。pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}的中位数为 0\.29,最高为 OPT-1\.3B 上的 0\.65。在种子平均值上,14 个模型中有 12 个高于基线。这些模型的测试折包含 63 到 178 个错误试验,图1 (https://arxiv.org/html/2609.11216#S2.F1)B 中每个模型的值分母至少是预定下限的两倍。

模型间差异很大,从最弱模型上接近零的优势到 OPT-1\.3B 和 Pythia-1\.4B 上超过指标范围一半的优势。经常失败的模型在简单试验上也会失败。这种差异可能只是反映了每个模型的错误率,但在报告 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}的 14 个模型中,它反而随着任务准确率上升(Spearman ρ=+0\.63, p=0\.017)。在我们能测量的模型中,任务表现更好的模型通常有更多可读性故障,这是一个描述性相关。

通过测试准确率选择探针层会将报告的量拟合到报告的折上并夸大准确率值。我们基于验证折选择层以避免这一点。在 16 个模型中的 10 个上,层选择随种子变化。

Qwen2\.5-14B 和 OLMo-2-7B-Instruct 低于故障次数下限。Qwen2\.5-14B 在 0\.979 的试验中回答正确,在 200 个试验的测试折中留下约 4 个错误试验。OLMo-2-7B-Instruct 在 0\.943 的试验中回答正确,留下约 11 个。因此未报告它们的 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}值。将未报告的单元格视为未能超过基线,会让两个没有贡献测量值的模型降低估计值。上面的正相关表明,未报告 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}的接近上限的模型可能具有最多的可读性故障。

### 3\.2 反事实控制

探针可能通过读取哪些义务在词汇上存在,或最近的义务,来达到这些准确率,而根本不需要表示任何绑定。查询实体的反事实将这些解释与绑定的读取区分开来。固定一个声明,我们为它的每个 KK 个实体依次生成查询,并询问探针解码是否遵循与实际查询实体绑定的义务。声明的义务及其顺序在这些 KK 个查询中相同,只有查询实体发生变化,因此读取标记存在性或近期性的探针得分为 1/K1/K,而读取绑定的探针跟踪查询。跨模型的反事实准确率从 0\.11 到 0\.98 不等,在 16 个模型中有 15 个超过基线,模型聚类优势为 +0\.371(95% CI \[\+0\.243, +0\.503\])。唯一在基线上的模型 Pythia-410M,也是其 pAcc|wrong\mathrm{pAcc\}\\\!mid\!\\mathrm{wrong}优势低于 1/K1/K 最多的模型(-0\.048);控制实验在没有优势可解释的地方正好是零。逐模型值见附录B (https://arxiv.org/html/2609.11216#A2)。

因此,失败的试验保留了查询绑定的特定查询线性信号。该信号在这些试验上并未决定输出。该测量是对模型故障的平均,并未将任何单个试验识别为可读。线性可解码性也仅表明信息以线性映射可读的形式存在。这比模型使用信息的证据要弱,第5节(https://arxiv.org/html/2609.11216#S5)通过干预检验了更强的主张。

### 3\.3 在另外八个模型上的复制

一个独立的重新实现,与发布流水线不共享分析代码,并在不同的硬件上运行,在 K=4K\{=\}4 且无干扰块的情况下,在跨越四个家族的八个模型上重复了故障条件探针、反事实和测量。高于 1/K1/K 的优势在所有八个模型上都得到复制:故障条件探针准确率在 K=4K\{=\}4 时从 0\.474 到 0\.799 不等,而存在集合基线为 1/K=0\.251/K=0\.25,不一致分数在 AUROC 0\.813 到 0\.951 之间区分错误和正确的试验。查询反事实在运行它的四个模型上得到复制。在声明块保持逐位相同且仅改变查询实体的情况下,探针在 0\.733–0\.866 的范围内解码新实体的义务,而在 0\.095–0\.132 的范围内解码原始实体的义务,低于相同的基线。

## 4 内部-外部不一致预测错误

### 4\.1 带符号的不一致分数

如果状态在故障上保持可读,探针可能在推理时标记这些故障。探针自身的置信度是一个糟糕的信号。如第3节(https://arxiv.org/html/2009.11216#S3)所述,探针通常在模型回答错误的试验上是正确的。

相似文章

# 语音LLM推理中的实体绑定失败:诊断与思维链干预 ## 摘要 大型语言模型(LLM)在多模态推理任务中表现出色,但当输入来自语音识别系统时,往往会出现一类特定的错误:**实体绑定失败**(Entity Binding Failure)。本文系统诊断了这一问题的成因,并提出了基于思维链(Chain-of-Thought, CoT)提示的干预策略。 --- ## 1. 引言 语音转文本(ASR)系统与LLM的结合已成为对话式AI的核心架构。然而,ASR输出往往包含歧义性转录、同音词混淆以及命名实体识别错误,这些问题会在LLM推理阶段引发所谓的"实体绑定失败"——即模型无法正确地将语义角色与对话中的具体实体关联起来。 典型场景包括: - 多说话人对话中的指代消解错误 - 数字、日期、人名的歧义转录 - 专有名词(产品名、地名)的同音替换 --- ## 2. 实体绑定失败的定义与分类 ### 2.1 定义 **实体绑定失败**是指在推理过程中,模型将某一语义属性(如动作、状态、关系)错误地归属于上下文中的某个实体,而非其正确的指称对象。 ### 2.2 失败类型分类 | 类型 | 描述 | 示例 | |------|------|------| | **同音替换错误** | ASR将实体名替换为发音相似的词 | "苹果" → "平果" | | **指代歧义** | 代词无法确定性地解析到某一实体 | "他说他打了他" | | **跨句实体漂移** | 实体在多轮对话中被错误追踪 | 主语在换话轮后发生偏移 | | **数值实体混淆** | 数字、单位、日期被错误绑定 | "三点" = 时间 vs. 分数 | | **嵌套实体错误** | 复合实体中的成分被错误拆解或合并 | "北京大学医院" 的边界划定 | --- ## 3. 失败诊断方法 ### 3.1 对比探针测试(Contrastive Probing) 通过构造最小对比对(minimal pairs)来定位绑定失败: ``` 输入A(正确转录):张伟批评了李明,因为他迟到了。 输入B(ASR转录):张伟批评了黎明,因为他迟到了。 ``` 观察模型在两种输入下的实体归属判断是否一致,从而识别同音替换导致的绑定错误。 ### 3.2 注意力权重分析 对Transformer架构中的交叉注意力权重进行可视化分析,检测模型在生成实体相关token时的注意力分布是否聚焦于正确的上下文位置。 ### 3.3 自动评估指标 定义**实体绑定准确率(Entity Binding Accuracy, EBA)**: $$\text{EBA} = \frac{\text{正确绑定的实体-属性对数量}}{\text{总实体-属性对数量}}$$ --- ## 4. 思维链干预策略 ### 4.1 显式实体抽取CoT 在推理前,通过CoT提示引导模型首先显式列举并确认所有实体: ``` 提示模板: "在回答问题之前,请先: 1. 列出文本中出现的所有人名/地名/机构名 2. 标注每个实体的首次出现位置 3. 确认是否存在同音或相似的实体名 4. 在此基础上进行推理" ``` ### 4.2 渐进式消歧CoT 针对代词指代歧义,采用逐步消歧的思维链: ``` 步骤1:识别所有代词及其候选先行词 步骤2:利用语境约束(性别、数量、语义角色)逐步排除候选 步骤3:确定最终绑定关系 步骤4:基于确定的绑定关系执行推理 ``` ### 4.3 不确定性感知CoT 当ASR置信度较低时,引导模型进行多假设推理: ``` "ASR转录中存在低置信度片段:[黎明/李明]。 假设A:若实体为'李明',则... 假设B:若实体为'黎明',则... 综合上下文,最可能的解释是..." ``` ### 4.4 自我验证CoT 推理完成后,引导模型对实体绑定结果进行回溯验证: ``` "在给出最终答案前,请检查: - 每个实体的角色归属是否与原文一致? - 是否存在被遗漏或错误替换的实体? - 结论中的每一个断言是否都能追溯到具体的原文实体?" ``` --- ## 5. 实验设置 ### 5.1 数据集 - **AISHELL-NER**:中文语音命名实体识别基准 - **MagicData-RAMC**:多人对话语音数据集 - **自建评估集**:包含500条人工标注的实体绑定失败案例 ### 5.2 模型 | 模型 | 版本 | |------|------| | GPT-4o | 2024-05 | | Claude 3.5 Sonnet | 2024-10 | | Qwen-Audio | Turbo | | Gemini 1.5 Pro | 最新版 | ### 5.3 基线与对比条件 - **Baseline**:直接将ASR输出送入LLM - **CoT-Generic**:通用思维链提示 - **CoT-EBF**:本文提出的实体绑定专用CoT - **Oracle**:使用人工校正的转录文本 --- ## 6. 实验结果 ### 6.1 整体EBA比较 | 方法 | GPT-4o | Claude 3.5 | Qwen-Audio | 平均 | |------|--------|------------|------------|------| | Baseline | 71.3% | 68.9% | 64.2% | 68.1% | | CoT-Generic | 74.8% | 72.1% | 67.5% | 71.5% | | CoT-EBF(本文) | **83.6%** | **81.2%** | **76.4%** | **80.4%** | | Oracle | 91.2% | 89.7% | 85.3% | 88.7% | ### 6.2 按失败类型的改进分析 CoT-EBF在不同失败类型上的EBA提升幅度(相对于Baseline): ``` 同音替换错误: +14.2% ████████████████ 指代歧义: +11.8% █████████████ 跨句实体漂移: +9.3% ██████████ 数值实体混淆: +7.6% ████████ 嵌套实体错误: +12.1% █████████████ ``` ### 6.3 CoT组件消融实验 | CoT组件 | EBA | |---------|-----| | 无(Baseline) | 68.1% | | + 显式实体抽取 | 73.4% | | + 渐进式消歧 | 76.9% | | + 不确定性感知 | 79.1% | | + 自我验证 | 80.4% | --- ## 7. 案例分析 ### 案例1:同音替换导致的绑定失败 **ASR转录**: > "董事会决定让王总接替李总的职务,他将在下月正式就任。" **ASR错误版本**: > "懂事会决定让王总接替李总的职务,他将在下月正式就任。" **Baseline模型输出**(失败): > 模型将"懂事会"解析为某个人名,导致后续代词"他"的绑定对象产生歧义。 **CoT-EBF干预后**: > 模型在推理第一步识别到"懂事会"可能是"董事会"的转录错误,基于语境将其修正为机构实体,并正确将"他"绑定至"王总"。 --- ### 案例2:多轮对话中的实体漂移 **对话记录**: ``` 轮次1 - 用户A:"张三昨天提交了报告。" 轮次2 - 用户B:"他说内容有问题。" 轮次3 - 用户A:"那是谁的责任?" ``` **Baseline失败原因**: 在轮次2中,"他"可能指张三或用户B,模型未能利用说话人身份信息进行消歧,导致责任归属错误。 **CoT-EBF处理**: 渐进式消歧步骤引导模型考虑说话人轮次信息,识别出轮次2中的"他"在语用层面更可能指代不在场的第三方(张三),从而正确锁定责任归属。 --- ## 8. 讨论 ### 8.1 CoT干预的局限性 1. **计算开销**:显式实体抽取和多步推理增加了token消耗,平均增幅约为40-60%。 2. **级联错误风险**:若CoT第一步的实体抽取本身出错,后续步骤可能放大错误。 3. **跨语言迁移**:本文实验主要基于中文语料,CoT模板的跨语言效果有待验证。 ### 8.2 与RAG的结合潜力 将实体绑定CoT与检索增强生成(RAG)相结合,利用知识库对候选实体进行验证,有望进一步提升同音替换场景下的绑定准确率。 ### 8.3 端到端语音LLM的影响 随着端到端语音LLM(如 Qwen-Audio、Gemini 1.5 Pro)的普及,ASR与LLM的分离架构将逐渐减少,但实体绑定问题在端到端模型中仍以隐式形式存在,CoT干预策略同样适用。 --- ## 9. 相关工作 - **实体链接与消歧**:[Sevgili et al., 2022] 对神经实体链接方法的综述。 - **语音识别错误鲁棒性**:[Belinkov & Glass, 2018] 关于NLP模型对输入噪声的脆弱性分析。 - **思维链推理**:[Wei et al., 2022] CoT提示的奠基性工作;[Wang et al., 2023] 自一致性CoT。 - **多模态LLM推理**:[Driess et al., 2023] PaLM-E 中的跨模态实体推理。 - **指代消解**:[Stoyanov et al., 2010] 基于机器学习的共指消解研究。 --- ## 10. 结论 本文系统诊断了语音LLM推理中的实体绑定失败问题,提出了涵盖五种失败类型的分类体系,并设计了由四个模块组成的CoT干预框架(显式实体抽取、渐进式消歧、不确定性感知推理、自我验证)。实验结果表明,CoT-EBF相比Baseline在实体绑定准确率上平均提升 **12.3个百分点**,在同音替换错误和嵌套实体错误类型上尤为显著。 未来工作将聚焦于: - 自动CoT模板生成(减少人工设计成本) - 与端到端语音LLM的深度集成 - 低资源语言场景下的泛化性验证 --- ## 参考文献 1. Wei, J., et al. (2022). Chain-of-thought prompting elicits reasoning in large language models. *NeurIPS 2022*. 2. Wang, X., et al. (2023). Self-consistency improves chain of thought reasoning in language models. *ICLR 2023*. 3. Belinkov, Y., & Glass, J. (2018). Analysis methods in neural language processing. *TACL*. 4. Sevgili, Ö., et al. (2022). Neural entity linking: A survey of models based on deep learning. *Semantic Web Journal*. 5. Driess, D., et al. (2023). PaLM-E: An embodied multimodal language model. *ICML 2023*. 6. Stoyanov, V., et al. (2010). Coreference resolution with reconcile. *ACL 2010*. --- *本文为技术分析性文章,实验数据为示意性结果,旨在说明方法论框架。*

arXiv cs.CL

本文识别了语音大语言模型(SLLMs)中一种局部化的"实体绑定失败"现象——即涉及实体追踪的逻辑推理准确率骤降至随机水平,并提出了实体感知思维链(EA-CoT)提示方法来解决这一问题,最终实现了高达 24.4% 的绝对准确率提升。

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

arXiv cs.AI

This paper investigates the 'knowing-saying gap' in language models, showing that linear probes can detect corrupted context with near-perfect accuracy yet fail to predict final answer errors, with implications for deployment monitoring and intervention strategies.