错误的架构:从普遍不可能性到局部补丁的LLM可靠性
摘要
本文论证了通用LLM可靠性是不可能的,但在操作上受限的补丁(如法律审查、医学RAG)内,失败是稀疏且重复的,使得可靠性成为一个局部目录发现问题。本文通过两个命题和一个推论将其形式化,重新定位而非消解长上下文生成的困难。
arXiv:2605.30628v1 公告类型:新
摘要:通用LLM可靠性不是一个有限库问题:在所有可能的任务、工具、模式、知识源和评估者期望中,新的可通过干预区分的失败模式可能无限出现,因此没有有限的干预词典能保证每个此类模式的残余误差有界。但部署的系统并不在整个宇宙中运行。它们在操作上受限的补丁(法律审查、医学RAG、代码修复、客服代理、合同提取)内运行,具有重复的任务、模式、工具和评估者期望。在这些补丁内,经验证据表明失败是稀疏、重复且集中在一个小的重复目录中,因此可靠性成为一个局部目录发现和干预覆盖问题,而不是指数级令牌长度问题。我们通过两个命题和一个推论将此转变形式化。命题1是最坏情况模式方面的负面结果:没有有限的干预词典能覆盖无界域中每个可区分的失败模式。推论1是逆发现含义:模式发现的对数上界无法容纳线性更多的不同尾部模式,除非指数级更多地观察到硬失败事件。命题2是积极的局部补丁结果:在日志活跃模式暴露和头部重覆盖下,每个硬决策的足够干预预算随序列长度多项式对数增长,并在补丁目录饱和后变为域常数。该框架重新定位而非消解长上下文困难:当硬决策数量本身就随任务长度增长时,可靠性仍然困难;贡献在于识别轴内干预,而不是使这些区域变得容易。
查看缓存全文
缓存时间: 2026/06/01 09:26
# 从普遍不可能性到局部补丁级LLM可靠性 来源:https://arxiv.org/html/2605.30628 ## 错误架构:从普遍不可能性到局部补丁级LLM可靠性 Mikhail L\. Arbuzov 独立研究员 mike\.arbuzov54@gmail\.com &Lee Mosbacker 独立研究员 lee\.mosbacker@gmail\.com &Sisong Bei 独立研究员 qurining@gmail\.com Ziwei Dong 独立研究员 ziwei\.dong@alumni\.emory\.edu &Dmitri Kalaev 独立研究员 kalaevdr@gmail\.com &Alexey Shvets Palo Alto Networks ashvets@paloaltonetworks\.com ###### 摘要 通用LLM可靠性并非一个有限库问题:在所有可能任务、工具、模式、知识源和评估者期望中,新的可通过干预区分的失败模式会无界地出现,因此没有有限的干预词典能保证每个此类模式的残余误差有界。但已部署的系统并非在整个宇宙中运行。它们运行于操作上受限的补丁(法律审查、医疗RAG、代码修复、客服代理、合同提取)中,这些补丁具有重复出现的任务、模式、工具和评估者期望。在这些补丁内,经验证据表明失败是稀疏的、重复的,并集中在一个小型的重复出现目录中,因此可靠性成为一个局部目录发现和干预覆盖问题,而非指数级token长度问题。我们通过两个命题和一个推论来形式化这一转变。命题1 (https://arxiv.org/html/2605.30628#Thmproposition1) 是模式层面的最坏情况否定性结果:没有有限干预词典能覆盖无界域中的每个可区分失败模式。推论1 (https://arxiv.org/html/2605.30628#Thmcorollary1) 是反向发现推论:模式发现的对数上界无法容纳线性更多的不同尾模式,除非指数级增加观察到的硬失败事件。命题2 (https://arxiv.org/html/2605.30628#Thmproposition2) 是正面的局部补丁结果:在对数激活模式暴露和头部密集覆盖下,每个硬决策的充足干预预算随序列长度呈多对数增长,一旦补丁目录饱和,预算变为域常数。该框架并非解决长上下文困难,而是重新定位了困难:当硬决策数量本身随任务长度增长时,可靠性仍然困难;贡献在于识别轴上的干预措施,而非使这些区域变得容易。 ## 1 引言 关于长上下文自回归生成的标准担忧是指数级的。如果每个token具有独立的错误概率 \(e\),那么在 \(n\) 个token后,完全正确输出的概率为 \((1-e)^n\),对于任何非平凡的 \(e\) 和足够大的 \(n\),该概率会降为零 (LeCun,2023 (https://arxiv.org/html/2605.30628#bib.bib28); Dziri et al.,2023 (https://arxiv.org/html/2605.30628#bib.bib11))。本系列早期工作 (Arbuzov et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib1)) 认为这种担忧是错位的,因为错误并非均匀分布于所有token:只有5–10% 的token是“关键”的(真正依赖于长程上下文 (Fang et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib12))),而其余大部分token一旦积累了足够上下文就变得几乎确定。用双率模型 \(P(\text{correct}) = (1-e_{\text{key}})^k (1-e_{\text{non}})^{n-k}\) 替代 \((1-e)^n\),其中 \(k \ll n\) 且 \(k\) 随 \(n\) 次线性增长,恢复了观察到的长上下文连贯性,并将可靠性问题从“\(n\) 如何增长?”转变为“\(k\) 如何增长?”。 #### 从稀疏token到重复模式。 本文迈出了下一步。稀疏性告诉我们错误*在哪里*;自然的后续问题是它们*是什么*。最近的失败模式图谱提供了一个引人注目经验答案:错误不仅稀疏,而且*重复*。ErrorAtlas (Ashury-Tahan et al.,2026 (https://arxiv.org/html/2605.30628#bib.bib3)) 覆盖了35个数据集上的83个模型,将观察到的失败组织为按流行度排序的17个命名类别,其长尾分布高度集中于头部。在代码领域,两种错误类型(AssertionError 和 NameError)在HumanEval上覆盖了14个LLM中86.35%的失败,并在HumanEval Pro和MBPP Pro的23个模型上得到复制 (Wen et al.,2024 (https://arxiv.org/html/2605.30628#bib.bib61))。在数学领域,MWPES-300K (Sun et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib49)) 将15个LLM在四个数学应用题数据集上的304,865个错误进行了分类,并报告数据集特征系统性地塑造了错误模式。同样的情况出现在多跳问答 (Zhang et al.,2026 (https://arxiv.org/html/2605.30628#bib.bib67))、代理工具使用 (Cemri et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib4)) 和检索增强生成 (Wood and Forbes,2024 (https://arxiv.org/html/2605.30628#bib.bib62)) 中。这些观察表明可靠性架构中存在第三层,补充了关键token稀疏性(第1层)和键内分层流形结构(第2层,见 Arbuzov et al. 2025 (https://arxiv.org/html/2605.30628#bib.bib1))。在少量关键token中,只有一部分 \(\beta\) 产生*硬*失败,并且在有界的部署补丁内,这些硬失败似乎聚集在一个有限或有效封顶的重复出现模式目录中,其规模增长远慢于观察到的事件数量。 #### 贡献。 核心贡献是可靠性对象的转变。通用LLM可靠性不是一个有限库问题,但补丁局部可靠性可以被视为目录发现和干预覆盖。我们通过两个命题和一个推论来形式化这一转变。命题1 (https://arxiv.org/html/2605.30628#Thmproposition1) 是模式层面的最坏情况否定性结果:如果无界域持续产生可干预区分的失败,则没有有限干预词典能保证域中每种模式的残余误差有界。推论1 (https://arxiv.org/html/2605.30628#Thmcorollary1) 是对数上界的反向发现含义:该上界无法容纳线性更多的不同尾模式,除非指数级增加观察到的硬失败事件,因此开域尾模式发现的收益迅速递减。命题2 (https://arxiv.org/html/2605.30628#Thmproposition2) 是固定部署补丁内匹配的正面结果。在对数激活模式暴露和头部密集覆盖下,每个硬决策的充足干预预算满足 \(m \geq \lceil |C_{\text{eff}}|^{1 - \varepsilon / e_{\text{hard}}} \rceil\),乐观情况(饱和前)下序列长度率呈双对数,一旦补丁目录饱和,预算变为域常数。序列层面的类比更严格,并随着 \(k\) 增长趋近于全目录覆盖;我们揭示了这种不对称性而非隐藏它。围绕这一转变,本文做了四项支持性工作。一个三层框架,包括稀疏性 (\(\alpha\))、硬token分层 (\(\beta\)) 和补丁局部模式目录 (\(|C_D|\)),将*哪里*发生错误、它们*是什么*重复形式、以及*哪些*能力干预能解决它们分离开来(§3 (https://arxiv.org/html/2605.30628#S3))。对数模式发现被表述为经验假定而非定理,根据ErrorAtlas、HumanEval和MWPES进行校准,锚点处 \(\sigma \in [0.87, 1.85]\),并取 \(\sigma \approx 1.85\) 作为保守规划值。第4节 (https://arxiv.org/html/2605.30628#S4) 综合了失败聚类、聚类选择性干预和次线性长度扩展的证据,引用了约60项之前发表的结果,包括六轴能力消除收获的28个定量锚定引用,按模式A/B/C分层(附录B (https://arxiv.org/html/2605.30628#A2))。最常被引用的陡降反例(附录C (https://arxiv.org/html/2605.30628#A3))被重新审计,并显示其衰减主要发生在任务结构变量上,包括组合图大小、事实数量、对数时间范围、容量阈值和证据范围,而非原始token长度。 ## 2 相关工作 #### 失败模式分类法。 ErrorAtlas (Ashury-Tahan et al.,2026 (https://arxiv.org/html/2605.30628#bib.bib3))、MWPES-300K (Sun et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib49))、Wen et al. (2024 (https://arxiv.org/html/2605.30628#bib.bib61)) 对HumanEval的分类、以及RFMDataset (Guo et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib19)) 共同表明,在任何给定的语料库规模下,不同命名失败模式的数量很小(通常为8-20),且顶部模式的累积覆盖率很高。针对多跳问答 (Zhang et al.,2026 (https://arxiv.org/html/2605.30628#bib.bib67))、多代理系统 (Cemri et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib4)) 和工具增强代理 (Yao et al.,2024 (https://arxiv.org/html/2605.30628#bib.bib64)) 的领域特定分类法报告了相同的模式。 #### 针对性干预。 每个命名的聚类都成为了针对性干预研究的目标。Python执行修复了大部分算术错误聚类 (Gao et al.,2023a (https://arxiv.org/html/2605.30628#bib.bib13); Chen et al.,2023 (https://arxiv.org/html/2605.30628#bib.bib5); Gou et al.,2024b (https://arxiv.org/html/2605.30628#bib.bib18));约束解码消除了格式违规 (Suresh et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib50); Wang et al.,2025b (https://arxiv.org/html/2605.30628#bib.bib56); Dong et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib10));执行反馈解决了大多代码逻辑错误 (Shinn et al.,2023 (https://arxiv.org/html/2605.30628#bib.bib48); Huang et al.,2023 (https://arxiv.org/html/2605.30628#bib.bib21));过程奖励模型减少了步骤级推理错误 (Wang et al.,2024b (https://arxiv.org/html/2605.30628#bib.bib58); Lightman et al.,2024 (https://arxiv.org/html/2605.30628#bib.bib32));RAG大幅减少了幻觉 (Wood and Forbes,2024 (https://arxiv.org/html/2605.30628#bib.bib62));偏好优化抑制了过度拒绝 (Karaman et al.,2024 (https://arxiv.org/html/2605.30628#bib.bib23));结构化不确定性修复了大多工具调用失败 (Suri et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib51))。出现了两个结构性观察:每种干预都是*聚类选择性*的(残余属于另一个不同命名聚类,而非目标聚类),且*可加性近似但不完美* (Patel et al.,2026 (https://arxiv.org/html/2605.30628#bib.bib42); Le,2026 (https://arxiv.org/html/2605.30628#bib.bib27))。 #### 长度衰减基准。 平行文献衡量可靠性衰减曲线的*形状*。温和衰减结果(Loong (Wang et al.,2024a (https://arxiv.org/html/2605.30628#bib.bib57))、GSM-\(\infty\) (Zhou et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib68))、RULER (Hsieh et al.,2024 (https://arxiv.org/html/2605.30628#bib.bib20))、基于锚点的LLM (Pang et al.,2024 (https://arxiv.org/html/2605.30628#bib.bib40)))报告了对数线性、S形或阈值型衰减,与平滑的 \((1-\varepsilon)^n\) 不一致。陡降结果 (Dziri et al.,2023 (https://arxiv.org/html/2605.30628#bib.bib11); Kuratov et al.,2024 (https://arxiv.org/html/2605.30628#bib.bib25); Kwa et al.,2025 (https://arxiv.org/html/2605.30628#bib.bib26); Wan et al.,2026 (https://arxiv.org/html/2605.30628#bib.bib54)) 有时被引用为指数复合证据。仔细阅读后,这种表面张力得以缓解:我们重新审计的每个陡降结果都衰减于一个不同于原始token长度的变量,附录C (https://arxiv.org/html/2605.30628#A3) 记录了这一点。 #### 空白。 缺少的是一个小型重复分类目录与多对数干预预算之间的定量桥梁。我们在§3 (https://arxiv.org/html/2605.30628#S3) 中提供了这座桥梁。 ## 3 理论框架 #### \(|C|\) 的四个层次。 在任何命题之前,先进行定义性设置。LLM错误分析通常混淆了本文其余部分需要区分的四个对象: - •L1:失败事件。基准测试中观察到的具体LLM错误;任何分类法的原始数据。 - •L2:经验分类类别。研究人员选择的L1事件标签。ErrorAtlas的17个类别、MWPES的前4类、以及HumanEval的 AssertionError/NameError 分区都位于此处。L2是可观察的,但依赖于分类者的分辨率选择。 - •L3:潜在失败模式。L2所近似的未观察到的底层聚类。L3是假定1 (https://arxiv.org/html/2605.30628#Thmpostulate1) 道德上要讨论的,但无法直接测量;我们将L2视为L3的有噪声代理。 - •L4:能力轴/干预。工程单元:Python解释器、约束解码器、检索增强生成器。在实践中,L4比L2更粗;一个能力轴通常同时针对多个L2类别(§4 (https://arxiv.org/html/2605.30628#S4),声明B)。 在本节中,\(|C|\) 指的是L2计数:这是已发表分类法报告的内容。假定1 (https://arxiv.org/html/2605.30628#Thmpostulate1) 因此是*工程*相关的,因为L4比L2更粗(所以一个小型干预库可以一次性覆盖多个类别),也是*认识论*上条件的,因为L2是实际L3模式目录的有噪声代理,其忠实度尚未独立测量。在正确层次上标记形式声明使框架在随意的错误谈论滑移时保持诚实。 #### 路线图。 该框架分离了三个经常被混淆的问题。首先,错误*在哪里*发生?只有稀疏的关键决策子集。其次,什么*类型*的错误重复出现?一个局部失败模式目录。第三,*什么*修复它们?一个更小的能力干预库。§3.4 (https://arxiv.org/html/2605.30628#S3.SS4) 的两个命题形式化了从普遍不可能性到补丁局部可处理性的转变:没有有限的干预词典能覆盖所有可能的部署,但在一个固定部署补丁内,一个充足的库是小规模且缓慢增长的。 ### 3.1 关键token的 \(\beta\) 分层 来自 Arbuzov et al. (2025 (https://arxiv.org/html/2605.30628#bib.bib1)) 的双率模型区分了 \(k\) 个关键token(错误率 \(e_{\text{key}}\))和 \(n-k\) 个非关键token(\(e_{\text{non}} \ll e_{\text{key}}\))。经验图谱表明,即使在关键token类内,错误也并非均匀分布:大多数关键token是模型具有稳定表示的“决策”;只有一部分集中了实际失败。 ###### 定义 1(硬分数)。 将序列中的 \(k\) 个关键token划分为容易和难子集, \(k_{\text{hard}} = \beta k, \qquad k_{\text{easy}} = (1-\beta)k, \qquad \beta \in (0,1)\),其中难关键token具有升高的错误率 \(e_{\text{hard}}\),对应于 Arbuzov et al. (2025 (https://arxiv.org/html/2605.30628#bib.bib1), §3.2) 意义上的流形过渡决策,而容易关键token具有 \(e_{\text{easy}} \approx e_{\text{non}}\)。 在定义1 (https://arxiv.org/html/2605.30628#Thmdefinition1) 下,组成的序列级可靠性变为 \(P(\text{correct}) = (1 -相似文章
LLM生成代码中的拼凑问题
本文形式化描述了'拼凑问题'——即LLM生成的代码在局部正确但在整个代码库中结构上不连贯的现象,提出了一个八类故障分类法和一个混合验证框架,并证明许多故障能够避开现有工具。
诊断不等于补救:语言协同适应解释LLM流水线中的修补风险
本文识别了多模块LLM代理中的'诊断悖论':对于失败因果性责任最大的模块(路由模块)并非最佳干预点,修补该模块反而可能损害性能。作者提出'语言契约'假说,并在三个代理系列中展示了实证证据。
通过结构不确定性量化LLM逻辑推理的一致性
本文引入结构不确定性框架,通过测量采样推理解中自偏好排名的稳定性来评估LLM推理一致性,补充了传统的答案离散度方法,用于识别不可靠的推理。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
判断、检索或放弃:具有可证明风险保证的不确定性防护LLM判断
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。