拒绝不等于鲁棒性:审计大型语言模型在可证无信息临床疼痛语音转录中的自信编造

arXiv cs.AI 论文

摘要

本文审计了大型语言模型在临床疼痛语音转录中的拒绝和编造行为,发现权威框架提示会导致如Gemini 2.5 Flash和Llama 3.1 8B等模型产生自信编造,而合作提示则显示出稳健的弃权行为。

arXiv:2608.26167v1 公告类型:新 摘要:幻觉和弃权基准很少确定模型不可能知道正确答案,使得区分适当的弃权与无根据的预测变得困难。七个大型语言模型在TAME疼痛语音语料库上进行了评估。参与者在一只浸入冷水或温水的手的情况下阅读语音平衡的Harvard句子,并仅在周期性疼痛陈述时报告疼痛。该协议生成了5,750个无信号Harvard句子语句,其转录稿不包含词汇疼痛信息,以及1,294个信号疼痛陈述语句,其中疼痛评分被明确说出。在无信号组中,疼痛可从声学特征中恢复(AUC 0.622,95% CI 0.553至0.662),而基于转录稿的预测接近随机水平(AUC 0.489,95% CI 0.418至0.504)。因为自动语音识别移除了声学疼痛线索,任何仅从转录稿推断的疼痛评分都没有可用证据支持。在合作提示下,六个模型在几乎所有无信号转录稿上弃权,在阳性对照任务中正确提取了口头疼痛评分,准确率从0.939到1.00不等,并保持了最多0.100的预期校准误差。在权威框架提示下,弃权变得依赖于提示,同一模型在等效提示短语中的范围从0.18到1.00。大多数模型在被迫回答时产生了低置信度估计,而Gemini 2.5 Flash和Llama 3.1 8B一致生成了自信疼痛评分,自信编造率分别为0.53和0.76,相比之下所有其他模型最多为0.15。在被迫响应中未观察到显著的人口统计学效应,所有$p$值大于或等于0.20。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:30

# 拒绝不等于稳健性:审计大型语言模型在可证明无信息临床疼痛语音转录中的置信捏造
来源:https://arxiv.org/html/2608.26167
Sagnik Dehttps://orcid.org/0009-0004-3092-5319 加尔各答大学无线电物理与电子学研究所 印度西孟加拉邦加尔各答 sagnikde2003@gmail\.com &Sreenija Pavulurihttps://orcid.org/0009-0006-3423-0826 南加州大学计算机科学系 美国加州洛杉矶 pavuluri@usc\.edu

###### 摘要

幻觉和拒绝回答的基准测试很少能证明模型不可能知道正确答案,这使得区分恰当的拒绝与无依据的预测变得困难。七款大型语言模型在TAME疼痛语音语料库上进行了评估。参与者在一只手浸入冷水或温水时朗读语音平衡的哈佛句子,并仅在周期性疼痛陈述中报告疼痛。该方案生成了5750个无信号哈佛句子话语,其转录文本不包含任何词汇疼痛信息;以及1294个信号疼痛陈述话语,其中疼痛等级被明确说出。在无信号组中,疼痛可从声学特征中恢复(AUC 0.622,95%置信区间0.553至0.662),而基于转录文本的预测则接近随机水平(AUC 0.489,95%置信区间0.418至0.504)。由于自动语音识别系统去除了声学疼痛线索,任何仅从转录文本推断的疼痛评分都缺乏可用证据的支持。在合作性提示下,六个模型在几乎所有无信号转录文本上都选择了拒绝回答,在阳性对照任务中正确提取了口头疼痛等级,准确率范围为0.939至1.00,并保持了至多0.100的预期校准误差。在权威框架提示下,拒绝行为变得依赖于提示,同一模型在等效的提示措辞下范围从0.18到1.00。大多数模型在被迫回答时产生低置信度估计,而Gemini 2.5 Flash和Llama 3.1 8B则持续生成高置信度的疼痛评分,置信捏造率分别为0.53和0.76,而其他所有模型最高仅为0.15。这种置信捏造代表了主要与安全相关的故障。它无法由合作行为预测(所有七个模型在此方面统计上无显著差异),且仅限于两个较小的模型。在被迫响应中未观察到显著的人口统计学效应,所有p值均大于或等于0.20。

## 1引言

大型语言模型越来越多地被置于临床环境的语音处理流程下游。患者说话,自动语音识别系统生成转录文本,模型基于该转录文本进行推理。ASR旨在保留词语并丢弃其他所有内容,包括语气、用力、颤音和声音中的哽咽。尤其是对于疼痛,临床医生依赖的大部分信息恰恰存在于ASR所丢弃的内容中。

当语音中具有信息量的部分被移除后,安全的行为不是猜测。一个值得信赖的临床模型应认识到输入无法支持一个有把握的判断,并应拒绝回答。用于验证医学语言模型的大多数基准奖励了相反的反应。医学问答套件,如MedQA(Jin等人,2021年)和MedMCQA(Pal等人,2022年),以及更广泛评估中的临床部分(Singhal等人,2023年),根据模型在干净书面文本上回答问题的能力来评分,这些文本中总是存在答案。它们很少测试同样重要的技能:识别何时没有可用答案,因此一个模型可以在这些排行榜上名列前茅,同时仍然从一个不包含疼痛信息的转录文本中编造出一个置信的疼痛评分。

研究这项技能的障碍在于证据层面。对于典型的输入,模型缺乏信息来回答的主张无法被证明,只能被怀疑,因为一个看似产生幻觉的模型可能使用了一些未被注意到的微妙线索。在信息缺失是被证明而非假设的背景下,对“我无法知道这个”这一陈述的正确识别无法被清晰地评分。

TAME疼痛语料库(Dao等人,2025年)使得这种缺失可以被证明。参与者将一只手保持在疼痛的冷水中,同时大声朗读标准化的、情绪中性的哈佛句子,例如“桦树独木舟在光滑的木板上滑行。”疼痛仅在形式为“我现在感受到的疼痛是____。”的简短疼痛陈述中被报告。在哈佛句子话语中,词语是固定的、疼痛中性的文本,按随机顺序分配,因此转录文本不携带关于说话者疼痛程度的任何信息。如果疼痛存在于音频中的任何地方,它就在声音本身中。在疼痛陈述话语中,数字被大声说出,因此一个正常工作的转录文本阅读器可以简单地将其记录下来。这两种话语类型定义了全文使用的无信号组和信号组。

无信号组是否真正无信息是通过对照实验来测量而非假设的,该实验在相同的话语上应用相同的分类器和交叉验证,仅改变输入表示。疼痛可从哈佛句子音频的声学中恢复,但不能从其转录文本中恢复。由于ASR保留词语而丢弃声音,一个仅基于转录文本的模型可证明地丢失了承载疼痛信息的通道。因此,在这些话语上,拒绝回答不是一种风格偏好,而是正确的行为,任何有把握的数字疼痛评分都是可证明的捏造。这里有两个要点。用作对照的声学分类器是一个简单的线性模型,因此报告的AUC是声学信息编码能力的保守下限。声学信息编码的内容可能部分反映了冷条件而非单纯的疼痛,尽管这并不影响旨在建立的音频与文本对比。

这种设计将恰当的谦逊转化为可检验的测试,并引出了三个问题。首先是模型是否在应该拒绝时确实拒绝了。其次是这种拒绝是否能经受住临床医生在实践中施加的轻微压力,例如紧急要求数字。第三是如果模型被迫捏造,其产生的评分是否取决于患者的人口统计学身份。在普通的合作性提示下,几乎每个模型行为都正确。在对抗性压力下,拒绝标志被证明对提示脆弱且粗略,一旦考虑到被迫回答的置信度,只有两个较小的模型,Gemini 2.5 Flash和Llama 3.1 8B,稳健且置信地捏造疼痛评分,这种失败无法由合作行为预测。在此队列规模下,未出现具有统计学意义的人口统计学效应。

本工作与先前拒绝回答基准有三点不同。首先,它建立在可证明无信号的临床语音测试平台上。一个按参与者分组的交叉验证对照表明,疼痛信号存在于声学中,并被ASR破坏,这使得在无信号组上的拒绝回答成为一个可检验的正确性标准。先前的LLM拒绝基准从未通过实证而非假设来建立信息缺失。其次,它引入了两个针对此场景的紧凑可靠性指标:幻觉置信度评分和可靠性分离指数,每个都经过定义和单元测试。第三,它应用了一个压力-稳健性协议,该协议根据压力框架改变措辞,并对被迫回答的置信度进行评分,表明仅合作行为会高估可信度。本着HELM等诊断基准的精神(Liang等人,2023年),目标是描述临床语音推理器如何以及在何处失败,而不是对它们进行排名。

## 2相关工作

医学语言模型基准。MedQA(Jin等人,2021年)、MedMCQA(Pal等人,2022年)以及如HELM(Liang等人,2023年)等广泛套件的临床部分,连同临床知识方面的工作(Singhal等人,2023年),评估的是考试式的问答,主要还是文本输入、文本输出,侧重于知识。本测试平台则针对一种模态——语音,以及一个目标——自我报告的疼痛,这些是上述套件未涵盖的,来解决可靠性问题。

选择性预测、拒绝回答和校准。大量工作研究模型何时应该拒绝回答以及其置信度是否可信,其中预期校准误差(Guo等人,2017年)是后者的标准总结。这些研究通常假设在一个干净的场景中,答案是可知的。而在这里,正确的行动通常是拒绝回答,并且这一事实是可证明的而非假设的,并额外审计了拒绝是否能在压力下持续。

阿谀奉承和提示导致的失败。已知模型在社会压力、诱导性问题和权威框架下会改变答案(Sharma等人,2024年)。关于模型撰写评估的相关工作记录了类似的提示敏感性(Perez等人,2023年)。该效应在此被量化于一个临床语音场景中,其中在压力下的正确行为——拒绝回答——是可证明定义的,并将其与一个具体的安全后果——捏造的疼痛评分——联系起来。更广泛的可信度调查(Huang等人,2024年)为通用的可靠性框架提供了动力。

从语音中评估疼痛。自动化疼痛评估主要由声学和面部分类器主导,它们直接预测疼痛,而不评估基于嘈杂转录文本的语言模型推理器是否可靠运行。本文使用轻量级声学分类器仅作为对照,以确定疼痛信号实际存在的位置。

## 3数据集

TAME疼痛语料库(Dao等人,2025年)托管在PhysioNet(Goldberger等人,2000年)上,包含来自51名参与者的7044条话语,约311分钟16kHz单声道音频,在冷加压任务期间录制。在将手浸入冷水或温水中时,参与者朗读哈佛句子,即标准化且语音平衡的、不包含情感或医学内容的句子。疼痛仅通过周期性疼痛陈述报告,形式为“我现在感受到的疼痛是___”,在第六条话语时说出,此后每五条说出一次,并将评级向后外推到之前的哈佛句子。七个注释文件标记了干扰项,每个片段都提供0到4的音频质量标签。

录制协议将语料库分为具有相反作用的两个组,如图1所示。无信号组由5750条哈佛句子话语组成,其词语是疼痛中性且随机分配的,因此转录文本不携带疼痛信息,对于仅基于转录文本的模型来说拒绝回答是正确的行为。信号组由1294条疼痛陈述话语组成,其中数字被大声说出,因此一个正常工作的转录文本阅读器应该能提取它。此组作为阳性对照。疼痛偏向低水平,其中1级占46.9%的话语,这是仅基于转录文本的模型无法通过猜测超越的基线率。另外542条话语由于音频中断、句子缺失或评级缺失而退化,在这些话语上拒绝回答也是正确的。队列规模小、年轻,平均年龄21.3岁,且人口统计学上存在偏斜,这是一个后文讨论的局限性。对于准确性基准来说是麻烦的属性,恰恰是使TAME疼痛成为一个可靠性测试平台的特性。

图注图1:TAME疼痛语料库概述。面板显示了信号组和无信号组之间的划分,疼痛水平分布偏向1级(占46.9%基线率),以及每个片段音频质量标签的分布。

## 4一个可证明无信号的测试平台

该基准基于一个实证主张:无信号话语的转录文本不包含关于说话者疼痛的可用信息。该主张在相同的话语上使用相同的协议进行检验,仅改变输入表示。二元疼痛(定义为与基线相比的任何疼痛)在哈佛句子话语上从两个特征集进行预测。声学集包含15个关于声音如何呈现的可解释描述符,包括时长、均方根能量统计、过零率、频谱质心、带宽、滚降点、基频均值和标准差,以及浊音比例。文本集是所说内容的词袋表示,仅限于出现在至少五条话语中的词,形成795个词的词汇表。两个特征集都经过相同的L2正则化逻辑回归、相同的交叉验证和相同的度量,因此任何差异都隔离了模态而非模型的影响。

评估使用按参与者分组的五折交叉验证,因此模型始终在训练中未出现的说话者上进行测试,这对于语音数据至关重要。标准化仅在训练折上进行,折外预测被汇总,计算ROC曲线下面积,置信区间来自参与者聚类自举(Efron和Tibshirani,1993年)。结果是决定性的,如图2所示。声学分类器AUC达到0.622,95%区间为0.553至0.662,而转录文本分类器AUC为0.489,区间为0.418至0.504,与随机水平无异且与声学区间不相交。疼痛编码在人们如何说话中,而非在他们说什么中。由于ASR保留词语而丢弃声音,一个仅基于转录文本的模型可证明地丢失了承载疼痛信息的通道。

进一步的检查排除了一个混淆因素,因为如果转录文本本身不可靠,仅基于转录文本的模型可能因错误的原因而失败。与每句话的中位数共识参考相比,平均词错误率为0.078,中位数为0.000,从最干净音频的0.053上升到最差音频的0.242。转录是忠实的,因此下游的失败应归因于推理而非转录。

图注图2:无信号组上的信号存在性对照。疼痛可从声学中以0.62的AUC恢复,但不能从转录文本中恢复,后者仅达到0.49,接近随机水平。两个置信区间不相交。

图注图3:评估流程。面板(a)显示音频被转录并分为无信号哈佛组和信号口头疼痛组,一个对照确定疼痛可从声学中以0.62的AUC恢复,但不能从转录文本中以0.49恢复。面板(b)显示两个组都通过一个固定的提示套件和七个缓存的语言模型,进行合作性评估和在三种措辞下每种框架施加的对抗性压力评估,记录每个被迫回答的置信度,以便

相似文章

当正确信念崩溃时:临床压力下LLMs的认知韧性

arXiv cs.AI

本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。