少样本退化并非表面所见:行为证据、表示分析以及跨12个模型、2个任务和2种架构的随机文本控制

arXiv cs.CL 论文

摘要

本文通过引入随机文本控制来挑战语言模型中少样本退化的扭曲假说,表明表示偏移主要由提示长度引起,而具有更高内容增量的模型从少样本提示中获益更多。

arXiv:2609.15990v1 Announce Type: new 摘要:少样本提示有时会退化语言模型而不是帮助它们,但其原因未知。我们在两个乌克兰任务——新闻分类和法律案件结果预测——上评估了12个开放权重模型,发现效应强烈依赖任务:在新闻上获得+24个百分点提升的相同模型在法律文本上仅获得+3.4个百分点提升,有两个模型退化。为了理解原因,我们深入模型内部。先前工作测量了零样本和少样本模式之间隐藏状态偏移的程度,但少样本提示要长得多,仅这种长度差异就能移动表示。我们提出一个简单的修复方法:用长度匹配的随机文本替换示例,以测量由提示长度引起的偏移,然后减去它。由此产生的度量内容增量隔离了模型表示因示例内容而非长度而改变的程度。这彻底改变了图景:原始偏移不能预测少样本是否有帮助或有害(r = 0.20),但内容增量可以(ρ = +0.65, p = 0.043)。更多地从示例内容重构表示的模型获益更多,这与直觉的“扭曲”解释相反。在Llama 3.3 70B中屏蔽示例因果性地证实了该发现,恢复了高于零样本基线的准确性。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:34

# 少样本退化并非表面所见:行为证据、表征分析与12个模型、2个任务、2种架构上的随机文本对照
来源:https://arxiv.org/html/2609.15990
Volodymyr Ovcharov  LEX AI 平台,legal.org.ua 乌克兰基辅

(2026年5月)

###### 摘要
当少样本提示导致语言模型性能下降时,直观的解释是*扭曲*:示例将模型的内部表征从正确答案处偏移,偏移越多,危害越大。我们证明这种解释是错误的。通过在12个开源模型上评估两个任务(新闻分类和乌克兰法律案件结果预测),我们发现原始的表征偏移并不能预测少样本提示是有益还是有害($r=0.20$)。原因是先前工作忽略的一个混淆变量:少样本提示比零样本提示长5-8倍,仅长度差异就能解释40%-79%的观察到的偏移。我们引入*随机文本对照*——用长度匹配的随机词元替换示例——以分离由示例*内容*引起的偏移与由提示*长度*引起的偏移。剩余部分,我们称之为*内容差值*,逆转了图景:模型因示例内容而表征变化越大,越能从少样本提示中受益($\rho=+0.65, p=0.043$),而非受害。退化最严重的模型(Llama 3.3 70B)在所有Transformer中具有最低的内容差值——其偏移几乎完全是长度伪影。将其对示例的注意力归零可因果性地将准确率恢复到零样本基线以上。这些发现确立了随机文本对照作为任何通过表征几何研究上下文学习的方法论必要步骤。数据:https://huggingface.co/datasets/overthelex/attention-analysis-fewshot。

关键词:扭曲假说、随机文本对照、表征偏移、内容差值、上下文学习、少样本退化、状态空间模型

## 1 引言
为什么少样本提示有时会让语言模型变差?自然的解释——我们称之为*扭曲假说*——是示例将模型的内部表征从正确答案处偏移:偏移越多,危害越大。这种解释是直观的,与观察到退化模型在少样本提示下表征发生大幅变化一致,并且在将表征偏移视为干扰诊断的工作中是隐含的(Hendel et al., 2023 (https://arxiv.org/html/2609.15990#bib.bib4); Wang et al., 2023 (https://arxiv.org/html/2609.15990#bib.bib13))。

我们证明它是错误的。

扭曲假说失败是因为它忽略了一个混淆变量:少样本提示比零样本提示长5-8倍。仅此长度差异就能显著移动表征——其幅度因模型而异,占观察到的总偏移的14%到79%。Llama 3.3 70B,我们评估中少样本退化最严重的模型,具有最高比例的长度驱动偏移(79%)和所有Transformer中最低比例的内容驱动偏移。其表征在少样本提示下变化很大,但几乎没有变化来自示例实际所说的内容。

为了区分长度与内容,我们引入*随机文本对照*:我们用长度匹配的随机词元替换示例并测量由此产生的偏移。从少样本偏移中减去此值即得*内容差值*——仅归因于示例内容的表征变化。内容差值逆转了扭曲预测:模型因示例内容而表征变化越大,受益越多($\rho=+0.65, p=0.043$),而非受害。将Llama 3.3 70B对示例词元的注意力归零可因果性地将准确率恢复到零样本基线以上,证实示例主动损害了该模型。

这些发现具有方法论意义:任何在未控制提示长度的情况下测量少样本提示下表征偏移的研究,都有得出相反结论的风险。随机文本对照易于实现(每个示例仅需一次额外的前向传播),应成为标准实践。

我们在两个任务上评估了9个架构族系的12个开源模型:新闻主题分类(SIB-200)和乌克兰法律案件结果预测(Ovcharov, 2026 (https://arxiv.org/html/2609.15990#bib.bib10))。第一部分(第4节 (https://arxiv.org/html/2609.15990#S4))建立行为范围:少样本效应具有强烈的任务依赖性(新闻平均$\Delta_{\text{FS}}$为+24 pp,法律为+3.4 pp),且有两个模型在至少一个任务上表现下降。第二部分(第5节 (https://arxiv.org/html/2609.15990#S5))剖析模型:我们提取零样本、少样本和随机文本条件下的隐藏状态,并表明一旦控制提示长度,扭曲解释就崩溃了。

## 2 相关工作
### 2.1 少样本学习与扭曲假设
Brown et al. (2020 (https://arxiv.org/html/2609.15990#bib.bib2)) 确立了少样本上下文学习作为LLM的核心能力。后续工作揭示了其脆弱性:性能取决于示例选择(Liu et al., 2022 (https://arxiv.org/html/2609.15990#bib.bib6))、格式一致性(Min et al., 2022 (https://arxiv.org/html/2609.15990#bib.bib8))、标签分布(Zhao et al., 2021 (https://arxiv.org/html/2609.15990#bib.bib15))和模型规模(Wei et al., 2023 (https://arxiv.org/html/2609.15990#bib.bib14))。Ovcharov (2026 (https://arxiv.org/html/2609.15990#bib.bib10)) 记录了乌克兰法律文本上的系统性少样本退化。

当少样本提示失败时,文献中的隐含解释是表征扭曲。Hendel et al. (2023 (https://arxiv.org/html/2609.15990#bib.bib4)) 表明ICL将示例压缩成隐藏状态中的任务向量;如果这种压缩有噪声,任务向量可能产生误导而非帮助。Wang et al. (2023 (https://arxiv.org/html/2609.15990#bib.bib13)) 证明标签词作为注意力锚点,为示例内容扭曲分类决策创造了路径。这两项工作均未明确测试表征偏移幅度是否预测退化——这是我们反驳的假设。

### 2.2 上下文学习的表征几何
越来越多的工作通过表征几何分析ICL。Dai et al. (2023 (https://arxiv.org/html/2609.15990#bib.bib3)) 将ICL形式化为隐式梯度下降,预测示例应将表征移动向任务特定最优值。Todd et al. (2024 (https://arxiv.org/html/2609.15990#bib.bib12)) 发现了函数向量——激活空间中编码任务映射的方向,可以在提示之间提取和移植。Olsson et al. (2022 (https://arxiv.org/html/2609.15990#bib.bib9)) 将归纳头识别为ICL的电路级机制。

这些解释预测ICL下的表征变化是*功能性的*:它编码任务相关信息。扭曲假说预测相反——变化是有害的。我们的随机文本对照通过表明观察到的大部分“扭曲”实际上是提示长度伪影,而内容驱动的残差确实是功能性的,解决了这一矛盾。

### 2.3 注意力与架构
Jain and Wallace (2019 (https://arxiv.org/html/2609.15990#bib.bib5)) 提醒注意力权重并非解释;我们通过经验确认了这一点(DAR与少样本收益无相关性)。对于SSM,Park et al. (2024 (https://arxiv.org/html/2609.15990#bib.bib11)) 表明Mamba在回归ICL任务上与Transformer匹配,但在检索上表现不足,这激发了我们的架构比较。Liu et al. (2024 (https://arxiv.org/html/2609.15990#bib.bib7)) 发现4位量化保留了包括ICL在内的涌现能力,尽管退化模式因任务而异——这与我们量化的Llama 3.3 70B结果相关。

## 3 实验设置
### 3.1 模型
我们评估了9个架构族系的12个开源模型(表1 (https://arxiv.org/html/2609.15990#S3.T1)):11个Transformer和1个SSM(Falcon Mamba 7B)。模型参数从7B到70B不等;Llama 3.3 70B使用4位NF4量化。所有模型均使用原生聊天模板,温度为0(贪婪解码)。对于Qwen3模型(8B、14B、32B),思考模式已禁用(enable_thinking=false)。推理使用transformers4.51和torch2.6在4×A10G GPU(总共96 GB)上进行。模型标识符列于附录A (https://arxiv.org/html/2609.15990#A1)。

表 1:评估的模型。Trans = Transformer,SSM = 状态空间模型。
### 3.2 数据集
#### SIB-200
(Adelani et al., 2024 (https://arxiv.org/html/2609.15990#bib.bib1)):7个类别的204个平行测试示例(新闻主题分类)。我们使用乌克兰语(ukr_Cyrl)。

#### ua-case-outcome
(Ovcharov, 2026 (https://arxiv.org/html/2609.15990#bib.bib10)):带有7类结果标签的乌克兰法院判决。我们使用196个分层测试示例(每类28个),事实截断至1500个字符,少样本示例截断至300个字符,以适应较小模型的上下文窗口。

### 3.3 内部指标
我们定义三个指标来分析不同提示条件下的模型内部。

#### 表征偏移。
零样本模式与少样本模式下分类位置隐藏状态之间的余弦距离:
$\text{shift}_{\text{FS}}=1-\cos(\mathbf{h}_{\text{ZS}},\mathbf{h}_{\text{FS}})$ (1)
这是扭曲假说预测应与少样本收益负相关的量。

#### 随机文本对照。
我们用长度匹配的随机文本替换示例(保持提示结构和长度)并测量由此产生的偏移:
$\text{shift}_{\text{rand}}=1-\cos(\mathbf{h}_{\text{ZS}},\mathbf{h}_{\text{rand}})$ (2)
这捕获了仅由提示长度引起的表征变化。

#### 内容差值。
差值分离出示例内容的影响:
$\Delta_{\text{cnt}}=\text{shift}_{\text{FS}}-\text{shift}_{\text{rand}}$ (3)
如果扭曲假说是正确的,$\Delta_{\text{cnt}}$应与少样本收益负相关。如果内容假说是正确的,它应正相关。

#### 示例注意力比率(DAR)。
最终词元注意力(最后4层,跨头平均)分配给示例词元与输入词元的比例。仅针对Transformer定义。

## 4 第一部分:行为结果
表2 (https://arxiv.org/html/2609.15990#S4.T2) 展示了所有12个模型在两个任务上的准确率。少样本效应具有强烈的任务依赖性:SIB-200新闻上的平均$\Delta_{\text{FS}}$为+23.9 pp,而法律文本上仅为+3.4 pp——减少了7倍。在新闻上,只有1/10有效模型退化;在法律上,2/10退化。

表 2:SIB-200(新闻,204个示例)和ua-case-outcome(法律,196个示例)上的少样本准确率。模型按法律$\Delta_{\text{FS}}$排序。粗体 = 退化。“fmt” = 无效输出。
![图1](https://raw.githubusercontent.com/your_repo/main/figure1_placeholder) 图1:按任务和模型划分的少样本效应。每个在新闻上受益的模型在法律文本上受益较少;两个模型在法律上退化(虚线下方)。模型按法律$\Delta_{\text{FS}}$排序。
几个模式显现。首先,少样本效应具有强烈的任务依赖性:每个在新闻上改进的模型在法律上改进较少。其次,Llama 3.3 70B在*两个*任务上都退化——是唯一一个具有持续跨任务退化的模型。这些行为结果引发了核心问题:*为什么*示例帮助一些模型却伤害另一些?扭曲假说提供了一个直观的答案:示例破坏了内部表征。我们在第二部分直接测试这一点。

## 5 第二部分:检验扭曲假说
### 5.1 提示长度混淆变量
如果扭曲假说是正确的,那么少样本提示下表征偏移更大的模型应该退化更多。图2 (https://arxiv.org/html/2609.15990#S5.F2) 揭示了这一预测失败的原因:少样本提示比零样本提示长5-8倍,仅长度差异就驱动了观察到的偏移的大部分。

![图2](https://raw.githubusercontent.com/your_repo/main/figure2_placeholder) 图2:12个模型的偏移分解。灰色 = 提示长度引起的偏移(随机文本对照)。红色 = 示例内容引起的偏移(内容差值)。Llama 3.3 70B的高总偏移(0.319)中79%是长度伪影;Granite 8B(0.610)中86%是内容。没有随机文本对照,两者无法区分。
表3 (https://arxiv.org/html/2609.15990#S5.T3) 量化了所有模型的分解。内容驱动偏移的比例从14%(Gemma 3 12B)到86%(Granite 8B)不等。关键的是,两个退化的模型——Llama 3.3 70B和Qwen3 14B——在具有有效行为数据的Transformer中具有最低的内容差值(分别为0.067和0.168)。它们的表征在少样本提示下发生了实质性变化,但几乎没有变化来自示例内容。

表 3:行为结果和内部指标。模型按内容差值($\Delta_{\text{cnt}}$)排序。Shift = 总表征偏移(公式1 (https://arxiv.org/html/2609.15990#S3.E1))。$\text{Sh}_{\text{rnd}}$ = 随机文本引起的偏移(公式2 (https://arxiv.org/html/2609.15990#S3.E2))。$\Delta_{\text{cnt}}$ = 内容差值(公式3 (https://arxiv.org/html/2609.15990#S3.E3))。粗体 = 退化。内部指标在SIB-200上测量。
### 5.2 内容差值逆转扭曲预测
图3 (https://arxiv.org/html/2609.15990#S5.F3) 绘制了内容差值与少样本收益的关系图。在SIB-200上,相关性为正且显著:$\rho=+0.648, p=0.043, n=10$。因示例内容而更多重构表征的模型从少样本提示中受益更多。在ua-case-outcome上,趋势一致但处于边缘($\rho=+0.588, p=0.074, n=10$),可能反映了法律$\Delta_{\text{FS}}$的压缩范围(-1至+10 pp vs. 新闻的-2.5至+47.5 pp)。

![图3](https://raw.githubusercontent.com/your_repo/main/figure3_placeholder) 图3:SIB-200上的内容差值与少样本效应。Spearman $\rho=+0.648, p=0.043$。扭曲假说预测负相关;数据显示正相关。
这是核心结果:扭曲假说预测表征变化与少样本收益之间为负相关;数据显示为正相关。符号反转是因为原始偏移混淆了两个信号:一个长度伪影(它不预测收益;$r=+0.20, p=0.59$)和一个内容信号(它预测)。没有随机文本对照,长度伪影占主导,掩盖了真实关系。

#### 稳健性。
共

相似文章

三进制语言模型中的能力分层性能退化

arXiv cs.AI

本文研究分析了三元量化语言模型中的能力分层退化现象。研究表明,尽管事实知识出现显著衰退,但常识推理能力和下游任务适应性仍得以保持,这使得该类模型在高效边缘部署中具有实用价值。