可靠性反向缩放:更大模型通过隐藏的自回归风险机制更快积累错误
摘要
本文发现,更大的语言模型存在一种隐藏的自回归风险机制,在该机制下,模型会承诺低概率词元,进而导致错误滚雪球式增长,使得可靠性随规模扩大而更快下降。研究表明,这种故障模式是因果性的、主导性的,并且对模型自身的自我监控不可见。
arXiv:2607.18292v1 公告类型:新
摘要:随着语言模型规模的扩大,答案起始更真实但退化更快:规模带来能力但侵蚀了可靠性。知识差距的解释——更多数据、检索或规模——忽略了规模放大的自回归风险残差:模型承诺一个低概率词元,将其视为既定事实并滚雪球。我们通过逐位置差异 $\delta = \log p_M - \log p_O$ 对抗更强的同系神谕来追踪这一点,其二阶矩精确分解为偏差$^2$ $\mathrm{KL}(p_M \,\|\, p_O)^2$ 和风险 $\mathrm{Var}[\delta]$。我们提出四个发现:(i) 在缩放过程中,知识差距下降约 $6\times$,而知识退化增长 $11$-$39\times$;(ii) 在捏造时刻,感知不确定性 $H(p_M)$ 迅速放松,而神谕参照风险持续长达 $17\times$,留下一个自信但不稳定的风险机制,连接连续的捏造($14$B 时 $+69\%$);(iii) 此机制是因果性的——一种在策略上的固定 $\mathrm{KL}$ 方差缩减在三个模型系列中将网络验证的幻觉降低了 $35$-$74\%$;(iv) 它结构性地规避了自我监控,仅基于 $p_M$ 的检测器(例如语义熵)在承载近 $4\times$ 更多捏造的风险分支上触发概率降低约 $30\%$($p<10^{-16}$)。更大的模型通过一种主导性、自我延续、因果性且对模型本身不可见的故障模式更快地滚雪球式出错。
查看缓存全文
缓存时间: 2026/07/22 08:18
# 更大模型更快地复合错误:隐藏的自回归风险机制
来源:https://arxiv.org/html/2607.18292
## 可靠性反向缩放:更大模型更快地复合错误——隐藏的自回归风险机制
###### 摘要
随着语言模型规模扩大,答案起初更真实但退化更快:规模买来了能力,却*侵蚀*了可靠性。知识差距理论(更多数据、检索或规模)忽略了一个自回归风险残差,而规模恰好放大了这个残差:模型承诺一个低概率 token,将其视为既定事实并进行条件化,从而产生雪崩效应。我们通过每个位置的差异 $\delta=\log p_M-\log p_O$(以更强同族模型为参照)来追踪这一过程,其二阶矩精确分解为*偏差* $2\mathrm{KL}(p_M\|p_O)^2$ 和*风险* $\mathrm{Var}[\delta]$。我们提出四个发现:(i) 在规模缩放下,知识差距下降约 $6\times$,而知识*退化*增长 $11$–$39\times$;(ii) 在捏造发生时,模型自身感受的不确定性 $H(p_M)$ 迅速放松,而参照风险持续长达 $17\times$ 之久,留下一个自信但岌岌可危的*风险机制*,该机制可连接连续的捏造事件(在 $14$B 规模下增加 $+69\%$);(iii) 该机制是因果性的——一种在策略上、固定 $\mathrm{KL}$ 的风险压缩可使三个模型家族的网络验证幻觉降低 $35$–$74\%$;(iv) 它在结构上规避自我监测,仅依赖 $p_M$ 的检测器(如语义熵)在风险分支上的触发率低约 $30\%$($p<10^{-16}$),尽管该分支持有的捏造数量几乎是其 $4\times$。更大模型雪崩式地更快犯错,其失败模式具有主导性、自我延续性、因果性,并且对模型自身不可见。
可靠性反向缩放:更大模型更快地复合错误——隐藏的自回归风险机制
Kushal Chakrabarti
Obviously Wrong, LLC
San Francisco, CA 94107
[email protected]
参见标题 参见标题
图 1:可靠性反向缩放;长文本幻觉是复合风险。
(a) 在 Qwen3 系列($0.6$–$32$B)的 LongFact++ 自由运行断言中,响应起始的知识差距(左)减小,而整个响应的知识退化(右)呈上升趋势,因此随着模型规模扩大,初始答案变得更真实,但自回归地衰减得更快(第 3.3 节)。
(b) 一种保持 KL 的风险压缩(偏差固定,漂移 $\ll \|\mathrm{KL}\|$)使三个家族六个模型的网络验证幻觉减少了 $35$–$74\%$(第 4.3 节)。能力和可靠性是独立的两个缩放轴。
## 1 引言
经典观点将幻觉视为训练时的知识差距(Kalai 等人,2026),但三个事实无法被解释:模型会在已知事实周围捏造(Simhi 等人,2025);每次捏造使得下一次在单次解码中更可能发生(Zhang 等人,2024);解耦并行表示能在*固定*数据和参数下减少幻觉(Chakrabarti 和 Balachundhar,2025)。这三个事实都涉及在前沿模型中因果调节幻觉的新动态。我们假设幻觉是模型所承诺的一个猜测,它播种了模型再也无法看到的自回归风险。为分析这一点,我们将误差分解为*交叉熵*(参照模型对模型预测的惊讶程度)、*熵*(模型自身感受的不确定性)和*风险*(两者在候选 token 上的差异的离散程度)。只有熵是自身可读的(Abbasi Yadkori 等人,2024;Kadavath 等人,2022):模型能感受自身的不确定性,但既无法感知参照模型的惊讶程度,也无法感知自身的风险。
参见标题 参见标题
图 2:在捏造开始时,每个通道都飙升,但模型自身可读的不确定性在一个 token 内就崩塌,而参照风险则自我延续。
(a) 对齐开始时刻的自由运行 LongFact++ 轨迹(按 Qwen3 阶梯,$0.6$–$8$B vs. Qwen3-14B 参照;$95\%$ 置信区间):偏差差距 $\mathrm{KL}(p_M\|p_O)$(红色)、熵 $H(p_M)$(绿色)和承诺风险 $\sqrt{\mathrm{Var}[\delta]}$(黄色)在第一个无支持的断言($t=t^\star_0$)处飙升,但自身可读的熵在一个 token 内减半,而参照的偏差差距和风险在下游持续存在,风险最持久(表 C.1)。
(b) 一个示例 Qwen3-8B 轨迹,token 按模型-参照*间隙机制*着色(而非正确性标签),基于偏差 $\mathbb{E}[\delta]$、熵 $H(p_M)$、风险 $\sqrt{\mathrm{Var}[\delta]}$:*扎根*(绿色;均值和离散度均小),*岌岌可危*(琥珀色;均值差距和熵低但风险高),*偏离*(红色;全部高)。初始处于扎根状态,在开始时刻转变,并不成比例地持有岌岌可危的下游状态;总体版本见面板 (a)。
自回归是一种将风险转化为偏差的机器。在捏造开始时,模型抽取一个不可支持的 token 并进行条件化,将瞬时的风险冻结为固定偏差(第 2 节);自身感受的不确定性放松,而参照风险持续存在(第 3.2 节),并且捏造会连锁反应,将下一个断言的危害比提高 $1.08\times$–$1.71\times$(随规模变化,第 4.1 节)。该危害搭载着一个可检测的载体。在连续的捏造之间,模型不成比例地占据一个自信但却岌岌可危的状态(低自身感受不确定性,高风险),最高在 $14$B 时达到 $+69\%$(第 4.2 节)。在捏造*之后*压缩风险可以切断连锁反应,使三个模型家族中响应其余部分的捏造降低多达 74%(第 4.3 节)。这重新定义了读取 $p_M$ 泛函的检测器(Kuhn 等人,2023;Farquhar 等人,2024;Manakul 等人,2023;Chen 等人,2024):它们在开始时敏锐,但对驱动下游捏造的岌岌可危分支视而不见。我们从四个方面证明我们的假设:
- •**幻觉机制。** $\delta=\log p_M-\log p_O$ 的矩解释了捏造,自回归将捏造开始后的风险转化为幻觉偏差(第 2 节)。
- •**可靠性反缩放。** 规模缩小了知识差距 $5.7$–$7.0\times$,但导致知识退化增长 $11$–$39\times$;能力和可靠性是独立的缩放轴(第 3 节)。
- •**机制因果性。** 一种过度自信的风险机制桥接了相邻的捏造,并且在开始之后压缩该风险可因果性地将网络验证幻觉降低高达 $74\%$(第 4 节)。
- •**检测器盲区。** 同一个机制在结构上规避了自我监测:仅依赖 $p_M$ 的检测器会错过它所驱动的捏造(第 4.4 节)。
## 2 自条件化将持续风险转化为偏差
表 1:规模缩小了知识差距但增加了知识退化:能力和可靠性是分开购买的。按评估和模型,事实支持与相对响应内位置的关系,均来自每个断言的随机截距逻辑广义线性混合模型(第 3 节,表 B.2):*初始差距* = 响应起始的幻觉率;*退化* = 从开始到结束幻觉率的相对上升——潜在承诺噪声的可观测特征;*支持* = 响应平均支持事实率。$\pm$ 为 $95\%$ 区间(*初始差距*和*退化*的变分贝叶斯可信区间,*支持*的响应聚类自举),$n$ 为每个拟合的断言数,每个家族最佳加粗。跨家族、任务和验证器,初始差距下降 $5.7$–$7.0\times$,而退化上升 $11$–$39\times$。
幻觉仅仅是知识差距吗?一个分歧变量说不是:它的矩同时恢复了作为差距的交叉熵和作为不确定性的熵,此外还有一个它们遗漏的——风险。通过自回归和训练协议从机制上解读,这些项产生了四个关于捏造如何产生、持续、传播以及在大规模下规避自我监测的预测(第 2.2–2.4 节)。
### 2.1 分歧变量及其矩
在位置 $t$,模型 $p_M(\cdot\mid y^{<t})$ 和参照模型 $p_O(\cdot\mid y^{<t})$ 产生分歧变量 $\delta_t = \log p_M(y_t^\star) - \log p_O(y_t^\star)$。将 $\delta_t$ 视为随机变量(在 $y_t^\star \sim p_O$ 下,给定前缀 $\mathcal{H}_t$),其均值 $\mathbb{E}[\delta_t]$ 是偏差,方差 $\mathrm{Var}[\delta_t]$ 是我们所说的*承诺风险*。二阶矩自然分解为偏置分量和风险分量:$$\mathbb{E}[\delta_t^2] = \underbrace{2\mathrm{KL}(p_M\|p_O)^2}_{\text{偏差}^2} + \underbrace{\mathrm{Var}[\delta_t]}_{\text{风险}}$$ (来自标准恒等式,利用 $y_t^\star \sim p_O$。公式 (2) 是核心分解。)
### 2.2 自回归捕获风险
### 2.3 风险在持续时间上超过偏差
### 2.4 捏造对自我监测隐藏
不对称性的推论会超出模型本身。基于此构建的检测器(采样分歧、预测熵和语义熵)(Kuhn 等人,2023;Farquhar 等人,2024;Manakul 等人,2023)是 $p_M$ 的泛函,因此根据公式 (2) 它们对风险项视而不见。它们唯一的立足点 $H(p_M)$ 在开始时飙升,随后放松,而 $\mathrm{Var}[\delta]$ 保持高位。
{预测} [检测器盲区] 仅依赖 $p_M$ 的检测器无法读取风险 $\mathrm{Var}[\delta]$,也无法有效检测由风险介导的捏造。第 3 节在矩上确认了风险集中和持续性不对称;第 4 节则探讨检测器盲区和自回归转化,通过因果性压缩来隔离风险。
参见标题 (a) 误差复合随规模增强,即使自发捏造变得更加罕见。
幻觉跟随另一个幻觉的相对风险 $\mathrm{RR} = \tfrac{P(\text{U}\mid\text{U})}{P(\text{U}\mid\text{S})}$(红色;阴影 $95\%$ 置信区间)从 $1.1\times$ 单调上升到 $1.7\times$(跨 $0.6$–$8$B;每个置信区间排除 $1$)。规模驱动自发率下降更快,而诱导(自条件化)率滞后,因此差距扩大,$\mathrm{RR}$ 上升。
参见标题 (b) 在规模下,模型平均而言更一致,但分歧更灾难性。
每个位置差距 $\delta_t$ 的超额峰度(左,实线)在每一个家族中均随规模上升——Qwen3 $8.9\to 33.0$,Llama-3.2 $18.4\to 32.6$,OLMo-3 $11.0$($7$B)——均 $\gg$ 高斯分布的 $0$,而平均差距 $\|\mathbb{E}[\delta]_t\|$(右,淡色)下降($1.17\to 0.28$):当典型误差缩小时,罕见偏移变得具有更厚的尾部。在共享语料库上与每个家族的最大参照模型进行教师强制(teacher-forced) 。
图 3:幻觉的方差面随规模以两种方式增强。(a) 跨断言的复合(幻觉引发下一个的相对风险 $\mathrm{RR}$)随 Qwen3 模型大小单调上升;(b) 每个位置参照差距的尾部($\delta_t$ 的超额峰度)远高于高斯基线,并单调上升,而平均差距在 Llama-3.2 和 Qwen3 中均缩小(OLMo-3 在 $7$B 处也印证)。
## 3 可靠性主导误差,风险随规模恶化
随着模型规模扩大,误差去哪了?能力上升,但主导误差转移到其他地方:风险。可靠性退化比能力提升更快(第 3.1 节),风险无法被模型自身代理读取(第 3.2 节),并且在份额和尾部两方面随规模恶化(第 3.3 节)。
### 3.1 可靠性退化比知识提升更快
可靠性退化比知识提升快数倍。在 Qwen3 阶梯中,知识差距缩小 $5.7$–$7.0\times$,而知识退化增长 $11$–$39\times$(表 1),通过每个断言的混合效应逻辑拟合估计,每个阶梯均显著(表 B.2)。误差反映的不是模型未能*知道*什么,而是它如何在已正确排序的候选者中进行*承诺*——即公式 (2) 中的风险项。
### 3.2 承诺打破模型风险代理
自身感受的不确定性 $H(p_M)$ 是唯一能代理承诺风险的 $p_M$ 自读泛函,在开始时它确实追踪了风险:$\mathbb{E}[\delta]$、$H(p_M)$ 和 $\sqrt{\mathrm{Var}[\delta]}$ 同时上升(图 2)。开始后,各通道分化(第 2.3 节):自读的 $H(p_M)$ 向基线崩溃(在 $8$B 下半衰期 $0.3$ token),而参照通道持续存在——$\mathbb{E}[\delta]$ 维持在开始前水平的 $1.4$–$1.9\times$(半衰期 $3.3$–$3.9$ token),承诺风险 $\sqrt{\mathrm{Var}[\delta]}$ 寿命最长,比它们还要慢 $1.1$–$1.3\times$($3.5$–$5.0$ token;表 C.1)。一旦被采样的 token 被追加,就固定了其分支上的差距,而局部可预测性——以及 $H(p_M)$——恢复,因此开始之后没有 $p_M$ 的泛函能追踪风险(公式 (2))。
### 3.3 风险随规模恶化
风险随规模沿两个轴线恶化:其尾部及其在误差中的份额。在模型的输出上实现后,每个位置的风险 $\mathrm{Var}[\delta]_t$ 比公式 (2) 中的偏差$^2$项缩得更慢,因此其在平方误差中的份额从 $1.7$B 时的 $31\%$ 上升到 $14$B 时的 $49\%$(图 4)。同时,差距的尾部也更厚:$\delta$ 的超额峰度从 $8.9$ 上升到 $33.0$(图 3(b))。因此,更大模型平均而言更频繁地与参照一致,但当不一致时分歧更大。
参见标题 图 4:承诺风险在随规模增大的每个位置误差中占据越来越大的份额。
教师强制 $\delta_t = \log p_M(y^*_t) - \log p_O(y^*_t)$(Qwen3 vs. Qwen3-32B;每个模型 $14,629$ token,$58$ 篇传记;省略 $0.6$B)。*顶部:* 已实现 token 的 $\delta_t$ 密度,随规模呈尖峰厚尾。*中部/底部:* 分布性偏差$^2$($\mathrm{KL}(p_M\|p_O)_t^2$)和风险($\mathrm{Var}_{p_M}[\delta]_t$)项(单位:nats$^2$);两者均缩小,但偏差$^2$ 项更快,因此风险在 $\mathbb{E}[\delta^2]_t$ 中的份额从 $1.7$B 的 $31\%$ 上升到 $14$B 的 $49\%$。这是图 2 中对齐开始时刻分解的横截面视图。
厚尾并非分散的;它定位到可识别的 token。相似文章
校准与决策:重新审视未学习语言模型中的可靠性悖论
本文重新审视了语言模型机器遗忘背景下的可靠性悖论,证明模型在依赖基于捷径的决策规则的同时能够实现较低的校准误差,从而将该悖论扩展至未学习模型。
鲁棒性的错觉:聚合精度掩盖了任务无关上下文下的预测翻转
本文揭示,在聚合层面大语言模型看似对任务无关上下文鲁棒,但在单个示例上预测可能翻转,部分示例性能下降而其他示例提升,突显了聚合精度所掩盖的尾风险。
语言模型如何失败:承诺性与持续性推理失败的词元级特征
本文通过词元级不确定性信号,刻画了语言模型在推理中失败的两种不同过程——承诺性失败与持续性不确定性,并展示了其对自一致性及失败检测策略的启示。
一些大型语言模型表现出一致的风险态度
本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。
大型语言模型中风险敏感决策的行为特征
本文研究了大型语言模型在不确定性决策中是否展现出稳定且可解释的风险偏好,通过德州扑克量化其基准风险倾向和上下文依赖的适应性调整。