论大语言模型适应性的局限:模型内化先验对标注任务性能的影响

arXiv cs.CL 论文

摘要

本文研究了LLM的内化先验如何影响零样本标注性能,发现近三分之二的错误抵抗基于提示的修正,并引入了定义特定熟悉度(DSF)作为比记忆化指标更好的预测因子。

arXiv:2606.00467v1 Announce Type: new 摘要:大语言模型(LLMs)越来越多地被用于零样本标注和LLM作为评判者的任务,然而其可靠性取决于模型内化先验与用户提供指令的交互方式。我们研究这种交互的三个维度:(1)LLM对数据和任务定义的熟悉程度如何影响性能,(2)提示中的额外信息在多大程度上能够纠正零样本错误(“决策粘性”),以及(3)模型对任务定义错位的敏感程度。通过在不同数据集(涵盖社交媒体、游戏、新闻和论坛)上进行毒性检测实验,并使用密集模型和混合专家模型,我们发现近三分之二的零样本错误难以纠正,提示的总体挽救率(通过提示纠正的初始错误比例)仅为34.8%。高置信度的错误尤其难以纠正。当给出错位定义时,LLM会遵循这些定义,同时保持与对齐条件相同的置信水平。关键在于,我们引入了定义特定熟悉度(DSF),该指标衡量模型内部概念与任务定义之间的对齐程度。在控制数据集层面混淆因素后,DSF与模型性能呈正相关(偏相关系数r = +0.41),而三种不同的记忆化指标(ROUGE-L、BERTScore和嵌入余弦相似度)均未表现出正相关。这些发现揭示了基于提示的修正方法在标注任务中的局限性,强调了定义对齐比文本层面记忆化更为重要。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:37

# 论大规模语言模型适应性的局限:模型内化先验对标注任务性能的影响  
来源:https://arxiv.org/html/2606.00467  

###### 摘要  

大规模语言模型(LLMs)越来越多地用于零样本标注和LLM-as-a-judge任务,然而其可靠性取决于模型内化先验与用户提供指令之间的交互。我们研究了这种交互的三个维度:(1)LLM对数据和任务定义的熟悉程度如何影响性能;(2)提示中的额外信息能在多大程度上纠正零样本错误(“决策粘性”);(3)模型对错误任务定义的敏感性。通过在多种数据集(涵盖社交媒体、游戏、新闻和论坛)上使用密集型和混合专家模型进行毒性检测实验,我们发现近三分之二的零样本错误难以纠正,整体拯救率(通过提示纠正的初始错误比例)仅为34.8%。高置信度错误尤其难以纠正。当模型收到错误定义时,它们会遵循该定义,同时保持与正确定义条件下相同的置信度水平。关键的是,我们引入了定义特定熟悉度(DSF),它衡量模型内部概念与任务定义之间的一致性。在控制数据集层面混淆因素后,DSF与模型性能呈正相关(偏相关系数r=+0.41),而三种不同的记忆指标(ROUGE-L、BERTScore和嵌入余弦相似度)均未显示正相关。这些发现揭示了基于提示的纠正在标注任务中的局限性,强调了定义对齐相对于文本级记忆的重要性。  

大规模语言模型,模型内化先验,零样本学习,提示可引导性,标注可靠性,模型可控性  

参阅图例  
图1:研究概览与研究问题。*左:*零样本标注设置:给定输入文本和用户提供的任务定义,LLM生成标签预测。*右:*我们研究模型内化任务概念与用户指令之间交互的三个层面。RQ1测试任务熟悉度是否与性能相关,对比*定义对齐*(定义特定熟悉度;DSF)与*文本记忆*指标(ROUGE-L、BERTScore、嵌入相似度;表4(https://arxiv.org/html/2606.00467#S4.T4))。RQ2在正确定义下衡量可引导性,探究零样本错误是否可以*被拯救*(拯救率),以及这如何依赖于置信度。RQ3探究对*错误*定义的敏感性,测试当提供的定义不正确时性能和置信度如何变化。插图中总结了每个问题的主要实证发现。  

## 1 引言  

LLMs越来越多地部署于零样本标注(Gilardi 等,2023(https://arxiv.org/html/2606.00467#bib.bib12))和基于评分标准的大规模评估(LLM-as-a-judge)任务(Zheng 等,2023(https://arxiv.org/html/2606.00467#bib.bib52);Liu 等,2023(https://arxiv.org/html/2606.00467#bib.bib24))。这些用例颇具吸引力:用户通过提示提供任务定义,模型无需标注训练数据即可大规模标注(Gilardi 等,2023(https://arxiv.org/html/2606.00467#bib.bib12);Brown 等,2020(https://arxiv.org/html/2606.00467#bib.bib3))。其隐含假设是用户的定义主导模型行为。但LLMs并非空白石板。通过基于网络规模语料库的预训练(Brown 等,2020(https://arxiv.org/html/2606.00467#bib.bib3)),继之以指令微调和来自人类反馈的强化学习(RLHF),模型形成了对常见概念和任务的隐含理解。当用户要求LLM检测“有毒”内容时,模型早已被数百万讨论、定义和示例化毒性的文档及人工评分示例所塑造,这些接触形成了对任务的内部概念。关键的是,这种内化概念可能与用户意图的定义不一致:毒性在不同应用场景中有不同的操作化方式——身份攻击(Borkan 等,2019(https://arxiv.org/html/2606.00467#bib.bib2))、在线游戏中的破坏性行为(Kocielnik 等,2024(https://arxiv.org/html/2606.00467#bib.bib20),2025b(https://arxiv.org/html/2606.00467#bib.bib22))或针对受保护群体的言论(ElSherief 等,2018(https://arxiv.org/html/2606.00467#bib.bib9))。锚定于特定理解的LLM可能无法同时匹配所有这些定义,其内化先验可能会限制用户指令引导模型行为及与用户意图一致的能力(Min 等,2022(https://arxiv.org/html/2606.00467#bib.bib27))。  

模型内化概念与用户指定定义之间的这种脱节代表了一个根本性的对齐挑战。当用户的任务定义与模型的内化概念相冲突时,哪个主导行为?先前工作表明,LLMs会反映出训练数据中的人口统计和观点偏差——无论是在预训练阶段还是在指令微调或RLHF之后(Nadeem 等,2021(https://arxiv.org/html/2606.00467#bib.bib30);Nangia 等,2020(https://arxiv.org/html/2606.00467#bib.bib31);Parrish 等,2022(https://arxiv.org/html/2606.00467#bib.bib35);Santurkar 等,2023(https://arxiv.org/html/2606.00467#bib.bib39))。提示和推理技术可能无意中放大此类潜在偏差(Shaikh 等,2023(https://arxiv.org/html/2606.00467#bib.bib41))。关于用户能否通过提示来覆盖模型内化的任务理解,其程度如何,或如何衡量模型内部概念与任务定义之间的一致性,我们知之甚少。我们通过三个研究问题(图1(https://arxiv.org/html/2606.00467#S0.F1))来探究这一张力:  

- •RQ1(熟悉度与性能):LLM对数据和任务定义的熟悉程度如何影响标注性能?  
- •RQ2(决策粘性):外部知识或专门提示能在多大程度上纠正初始零样本错误,模型置信度与可纠正性之间有何关系?  
- •RQ3(错误对齐易感性):当收到错误或不正确的任务定义时,LLM如何表现,置信度分数能否检测到这种错误对齐?  

为回答这些问题,我们评估了9个LLM,覆盖5个毒性检测数据集(涵盖社交媒体、游戏、新闻和论坛领域)。我们聚焦于毒性,因为LLM与人类任务特定定义之间存在较高的解释张力。我们引入了*定义特定熟悉度(DSF)*,一个量化模型内部任务概念与数据集具体定义之间一致性的指标。我们的关键发现是:(1)近三分之二的零样本错误通过任何提示策略(包括自动提示优化技术)都难以纠正,整体拯救率仅为34.8%;(2)高置信度错误尤其难以纠正,表现出强烈的“决策粘性”;(3)在控制数据集层面混淆因素后,DSF(计算为六个句子编码器在扩展的N=54面板上的共识)与哪些模型在标注上表现更好呈正相关(偏相关系数r=+0.41),而文本记忆未显示正相关(偏相关系数r=−0.19);(4)LLMs忠实遵循错误定义,但即使应用不正确指令时仍然保持高置信度,这揭示了关键的校准失败,阻碍了基于置信度检测定义错误。  

这些结果表明,对于标注任务,与任务定义的概念一致性(而非数据熟悉度)决定了模型性能,而模型通过训练和微调内化的任务概念锚定了其行为,限制了基于提示的引导的有效性。重要的是,我们将提示视为*控制通道*,并衡量由这些内化先验设定的该通道的基本限制。这补充了近期关于生成任务中可引导性的工作(Chang 等,2026(https://arxiv.org/html/2606.00467#bib.bib5))。我们发现,我们的指标DSF与哪些模型在给定任务上表现更好呈正相关,并表明置信度分数无法为检测模型是否应用了错误定义提供可靠信号。代码和分析流程已公开于 https://github.com/etmaca5/llm-internalized-priors-for-annotation。  

## 2 背景与相关工作  

#### LLM可引导性与可控性。  
近期工作将可引导性形式化为模型行为通过提示等干预手段从基线状态被移动的程度(Miehling 等,2025(https://arxiv.org/html/2606.00467#bib.bib26))。Chang 等(2026(https://arxiv.org/html/2606.00467#bib.bib5))引入了一个多维度目标空间框架来衡量文本生成中的可引导性,识别出三种关键失败模式:覆盖不足(罕见目标表征不足)、校准不当(过度寻求请求)和副作用(对未指定维度的意外改变)。他们的评估表明,当前的LLM即使在包括提示工程和强化学习在内的各种干预下也难以实现可靠的可引导性。我们的工作解决了一个互补性问题:在输出为离散标签而非生成文本的*标注*任务中,什么因素决定了模型能否被引导至特定的任务定义?我们发现了类似的失败模式:有限的可达性(顽固错误)、校准不当(在错误对齐下置信度平坦)和副作用(救援-破坏权衡)。  

#### LLM作为标注者与裁判。  
使用LLM评估其他模型或标注数据集已成为一种标准范式。Gilardi 等(2023(https://arxiv.org/html/2606.00467#bib.bib12))表明ChatGPT在文本标注任务上可以胜过众包工作者,而Zheng 等(2023(https://arxiv.org/html/2606.00467#bib.bib52))通过MT-Bench建立了LLM-as-a-judge评估。Kim 等(2024(https://arxiv.org/html/2606.00467#bib.bib19))介绍了Prometheus,一个专门针对细粒度评分标准评估进行微调的模型,突显了为评估任务进行专门对齐的重要性。然而,Baumann 等(2025(https://arxiv.org/html/2606.00467#bib.bib1))使用18种不同语言模型复制了来自21篇已发表研究的37个标注任务,发现配置选择在31%-50%的案例中可能导致错误结论。相关地,Kocielnik 等(2025a(https://arxiv.org/html/2606.00467#bib.bib21))表明,将模型概念与精心策划的人类定义对齐是大型玩家聊天标注可靠的前提条件,这激发了对显式定义对齐诊断的需求。研究人员仅通过少数几个提示改写,跨多个LLM,就能使大多数假设呈现出统计显著性——这一现象被称为“LLM黑客行为”。这表明,LLM应被视为需要严格验证的复杂仪器,而非便捷的黑箱标注者。  

#### 模型内化先验与标注可靠性。  
现代LLM在整个训练流程(预训练、指令微调、RLHF/DPO)中发展出强烈的内部先验,这些先验可能与用户提供的定义相冲突。Carlini 等(2021(https://arxiv.org/html/2606.00467#bib.bib4))证明LLM会记忆特定的训练实例,表明模型对常见概念(如毒性)有根深蒂固的认知。训练后对齐可能放大这些效应:Zhang 等(2026(https://arxiv.org/html/2606.00467#bib.bib50))识别出*典型性偏差*,即标注者在RLHF过程中系统性地偏好熟悉的文本,导致模型锚定于“典型”示例而非遵循细致的定义。Min 等(2022(https://arxiv.org/html/2606.00467#bib.bib27))表明,上下文学习通常由格式和标签空间驱动,而非输入-标签映射,这意味着模型即使有显式示例也可能不会完全覆盖其先验。关于基准污染的工作已经开发了Min-K%概率(Shi 等,2024(https://arxiv.org/html/2606.00467#bib.bib42))、BERTScore(Zhang 等,2020(https://arxiv.org/html/2606.00467#bib.bib51))和基于续写的检测(Golchin & Surdeanu,2024(https://arxiv.org/html/2606.00467#bib.bib13))等指标,但对于内化的*概念性*先验(相对于文本记忆)如何限制可引导性,仍知之甚少。  

#### 置信度与校准。  
仅凭模型准确性可能掩盖对标注可靠性至关重要的校准失败。关于LLM置信度估计的综述(Geng 等,2024(https://arxiv.org/html/2606.00467#bib.bib11))强调了过度自信和不可靠不确定性量化的挑战。黑箱置信度激发方法表明,当前LLM缺乏内部一致的置信度感知(Han 等,2025(https://arxiv.org/html/2606.00467#bib.bib15)),常常高估自报分数,同时在提示重新考虑时表现出较大变异性(Xiong 等,2024(https://arxiv.org/html/2606.00467#bib.bib47);Pawitan & Holmes,2025(https://arxiv.org/html/2606.00467#bib.bib36))。虽然言语化置信度在RLHF下可能比令牌概率校准得更好(Tian 等,2023(https://arxiv.org/html/2606.00467#bib.bib44)),但提示设计强烈影响可靠性(Yang 等,2024(https://arxiv.org/html/2606.00467#bib.bib48))。我们采用言语化置信度,以便适用于不公开令牌级概率分数的闭源模型。  

## 3 方法  

我们提出了一个框架来评估LLM通过训练和微调内化的先验(熟悉度)与通过提示的可引导性(对齐)在标注任务背景下的相互作用。  

### 3.1 熟悉度指标  

我们区分两种可能影响标注性能的熟悉度类型:*文本熟悉度*(模型是否记忆了数据集中的特定文本)和*定义熟悉度*(模型内部概念是否与任务定义一致)。它们代表了不同的机制:文本熟悉度表明性能源于生成记忆内容,而定义熟悉度表明性能源于概念性任务对齐。  

#### 文本熟悉度。  
通过提示模型在给定包含40%文本实例前缀的情况下生成后续内容,然后计算生成内容与剩余真实文本之间的ROUGE-L F1(基于最长公共子序列)(Lin,2004(https://arxiv.org/html/2606.00467#bib.bib23)),来衡量记忆情况。这改编了Golchin & Surdeanu(2024(https://arxiv.org/html/2606.00467#bib.bib13))用于污染检测的续写方法,以进行连续性熟悉度测量:我们使用通用续写提示(见附录B(https://arxiv.org/html/2606.00467#A2)),温度设置为0.0和0.7,取最高分数。为确保发现对记忆代理的选择具有鲁棒性,我们还使用DeBERTa-XL上下文令牌嵌入计算BERTScore F1(Zhang 等,2020(https://arxiv.org/html/2606.00467#bib.bib51)),并使用相同的句子编码器计算嵌入余弦相似度(即文中所指指标)。

相似文章

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。