使用确定性真实标签评估长文本生成中的LLM不确定性

arXiv cs.AI 论文

摘要

引入SALT,一个具有确定性真实标签的基准,用于在长文本生成中评估LLM在细粒度原子级别的不确定性。对超过50个LLM的分析揭示了关于置信函数、错误传播以及与推理权衡的见解。

arXiv:2607.03870v1 Announce Type: new 摘要:随着LLM生成越来越长的输出,有效的不确定性估计必须在细粒度级别识别错误,而不是丢弃整个响应。虽然存在这样的方法,但在任何分辨率(从token到整个生成)上评估不确定性都具有挑战性,且对标签不完美高度敏感,因此零噪声基准至关重要;然而,长文本生成基准往往依赖有错误的标签,而非确定性真实标签。我们介绍了单答案原子长文本目标(SALT),这是一个包含六个程序生成任务的基准,具有单一的确定性长文本真实标签,能够在不依赖外部评判的情况下进行单元级别的正确性、校准和排名评估。借助SALT,我们对50多个LLM的分析揭示了关键见解:我们识别出哪些置信函数主导了每个不确定性方面,并表明置信排名在原子分辨率下基本失效,即使在更粗的行级单元中出现了更清晰的可分性。SALT还能够在整个生成过程中进行受控的原子级干预,揭示了未来错误的两个可分离驱动因素:来自受损前缀的传播(由全局上下文正确性主导)以及由答案-上下文长度增加引起的有限退化。最后,我们证明了推理(通过思维链提示或通过训练内化)引入了一种权衡,提高了准确性但降低了置信排名。这些发现直接影响需要可靠错误识别和缓解的风险关键型应用。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:35

# 评估长文本生成中LLM的不确定性:基于确定性真实值的视角

来源:https://arxiv.org/html/2607.03870

###### 摘要

随着LLM生成越来越长的输出,有效的不确定性估计必须能在细粒度层面识别错误,而不是直接丢弃整个回复。尽管已有此类方法,但在任何分辨率(从单个词元到整个生成文本)上评估不确定性都极具挑战性,且对标签缺陷高度敏感,因此零噪声基准至关重要;然而,长文本生成基准往往依赖易错标签而非确定性真实值。我们引入了单答案原子长文本目标(SALT),这是一个由六个程序化生成任务组成的基准,每个任务都包含单一确定性的长文本真实值,从而可以在无需外部评判的情况下,在单元层面评估正确性、校准度和排序。借助SALT,我们对50多个LLM的分析揭示了关键发现:我们识别出在不确定性各个方面占据主导地位的置信度函数,并表明在原子分辨率下置信度排序基本失效,即使在线级粗粒度单元上存在更清晰的分离性。SALT还允许在整个生成过程中进行受控的原子级干预,揭示了未来错误的两个可分离驱动因素:来自受损前缀的传播(受全局上下文正确性主导),以及因答案上下文长度增加而导致的有界退化。最后,我们证明,通过思维链提示或训练内化的推理引入了一种权衡:在提高准确性的同时损害了置信度排序。这些发现直接影响需要可靠错误识别和缓解的风险关键型应用。我们将代码发布在 github.com/IdoAmit198/SALT。

不确定性估计,基准,LLM

参考图注 图1:使用SALT进行细粒度不确定性评估。将长文本生成分解为高分辨率单元,可以隔离局部错误,揭示出被粗粒度、生成级评估所掩盖的精确校准(ECE)和排序(AUROC)信号。

## 1 引言

大型语言模型(LLM)在各种自然语言处理(NLP)任务中展现出卓越的能力,日益推动其在现实世界中的应用。然而,由于它们倾向于生成事实上不正确的内容,在高风险环境中的部署充满风险。在医疗保健等领域,LLM被探索用于初始患者评估和决策辅助,错误可能导致严重后果(Agarwal 等人,2024; Kim 等人,2025)。为了减轻这些风险,稳健的不确定性估计是可信集成的关键组成部分,它能够支持诸如 *选择性生成*(Zablotskaia 等人,2023; Lee 等人,2024)等机制,模型在其中指示何时应放弃生成,以及 *可靠的决策支持*(Valente 等人,2021; Lindenmeyer 等人,2024),其中校准后的概率告知人类专家错误的可能性。随着现代LLM越来越多地生成长文本输出,例如跨越数十万个词元的软件仓库,其生成内容自然包含许多不同的语义组件。在单个输出中,某些组件可能是正确的,而其他组件则包含局部的错误或幻觉。在这种情况下,评估整个输出的不确定性是不够的。例如,一个提供多种可能疾病的诊断AI系统必须在组件级别进行校准,以帮助临床医生优先安排检测。此外,识别和修正特定的错误单元比丢弃一个长而基本正确的输出更有效率(Goren 等人,2026)。因此,可靠的部署需要细粒度的不确定性估计,涵盖排序和校准,以评估各个组件。

然而,在长文本生成中评估细粒度不确定性估计存在固有的挑战。首先,建立正确性本身就不简单:许多陈述可以有多种有效的实现方式,而另一些则可能无法在没有外部知识的情况下验证。其次,细粒度评估需要将自由形式的生成分解为更小的单元,这一过程通常模糊不清且对建模选择高度敏感。这些问题共同使得高分辨率的不确定性评估特别容易受到标签噪声和主观判断的影响。先前的工作通常通过专注于短文本生成或多项选择问答来简化评估,在这些设定下,正确性是明确的(Wang 等人,2024b; Zellers 等人,2019; Bisk 等人,2020; Sakaguchi 等人,2021; Clark 等人,2018)。然而,这些设定评估的是对预定义选择的置信度,而非对生成内容本身的置信度;或者评估的是短输出(几个词元或一个单词),而非现实世界生成所特有的微妙内容(Bakman 等人,2025)。近期的长文本基准将输出分解为由基于LLM的评判者或蕴含模型验证的“原子事实”(Manakul 等人,2023; Min 等人,2023; Wang 等人,2024a; Zhang 等人,2024b; Vashurin 等人,2025)。这种范式在分解和验证过程中引入了噪声,可能会严重扭曲不确定性指标,如附录I所示。此外,与不确定性分数共享偏差的正确性标签错误可能会系统性地扭曲AUROC排序(Santilli 等人,2025)。而且,脱离上下文提取陈述会使置信度信号与原始文本脱钩。

为了解决这些局限性,我们引入了单答案原子长文本目标(SALT),这是一个用于长文本生成中零噪声不确定性评估的基准。SALT包含六个程序化生成的任务,涵盖逻辑、数学、代码、翻译和多重针草(Multi-Needle)。每个任务的构造方式使得完整的长文本输出具有单一确定性的真实值,并且该真实值是事先已知的。这使得无需人工或基于模型的评判者即可进行精确的单元级标记。SALT模块化且可扩展,支持生成几乎无限数量的实例,并具有可控的难度,确保随着未来模型的发展,评估不受污染。我们总结的主要贡献如下:(1)我们引入了SALT,一个用于长文本生成的细粒度零噪声基准。(2)**生成过程中的细粒度不确定性评估**:SALT支持多种粒度的评估,允许在生成过程中持续评估不确定性,而不仅仅是在完整输出层面。(3)**对50多个LLM的大规模实证研究**:利用SALT,我们对超过50个当代LLM进行了全面评估,包括GPT-5.1、Gemini-3-Pro、Qwen-3、GLM-4.7和MiniMax M2.5,首次提供了对长文本生成中不确定性估计行为的大规模、无污染分析。(4)**关于不确定性和错误动态的关键见解**:SALT使得在长文本生成过程中进行高分辨率分析成为可能,揭示了(i)推理机制(CoT/推理模型)引入了“推理权衡”,在提高精确度的同时系统性地损害了置信度排序;(ii)置信度排序存在高分辨率失败模式:原始的置信度信号常常无法区分正确的原子和错误的原子,即使粗粒度排序仍然具有信息量;(iii)未来正确性有两个可分离的驱动因素:来自受损前缀的传播(受全局而非局部上下文正确性主导),以及因答案上下文长度增加而导致的有界退化。

## 2 问题设定

设 \(\mathcal{X}\) 和 \(\mathcal{Y}\) 分别表示输入空间和输出空间,两者都由词元序列组成,即对于有限词元词汇表 \(\Sigma\),有 \(\mathcal{X},\mathcal{Y}\subseteq\Sigma^*\)。给定一个输入序列 \(\mathbf{x}=(x_1,\dots,x_m)\),一个语言模型 \(f:\mathcal{X}\to\mathcal{Y}\) 产生一个输出序列 \(\hat{\mathbf{y}}=(\hat{y}_1,\dots,\hat{y}_{T_{\text{gen}}})\),其中 \(T_{\text{gen}}\) 表示生成的序列长度。我们通过显式输出围栏将 \(\hat{\mathbf{y}}\) 限制为模型的*最终答案*;中间推理词元不予考虑。

### 2.1 粒度和正确性

一个生成可以在不同粒度级别进行评估。虽然字符和词元是小的单元,本身几乎没有语义含义,但句子和文档是粗糙的,封装了大量信息。对中间粒度级别的需求可以通过一个矩阵乘法任务来说明。假设结果矩阵中一个元素是 \(135\)。在字符或词元级别评估此输出可能会给像 \(-130\) 这样的值部分分数,尽管在该任务的上下文中它是完全错误的。然而,仅在完整矩阵的级别评估正确性会忽略许多单独元素可能已经正确计算的事实,而错误源于少量的局部错误或幻觉。我们通过使用*评估单元*(可以独立评估的最小有意义的子组件)在中间粒度级别评估正确性来解决这种权衡。这种方法可以在不过度或不足惩罚生成的情况下实现精确的错误归因。虽然SALT支持任意分辨率,包括字符或词元级别(参见附录J),但我们将重点放在两个依赖于任务的分辨率上:*原子单元*(最小的独立意义,例如矩阵元素)和*行单元*(更大的逻辑分组,例如矩阵行)。

为了形式化这种中间粒度,我们将词元序列 \(\hat{\mathbf{y}}\) 分解为评估单元,这些单元是连续的词元跨度,代表原子语义组件。形式上,令 \(\hat{\mathbf{u}}=(\hat{u}_1,\dots,\hat{u}_{U_{\text{gen}}})\) 表示生成的 \(U_{\text{gen}}\) 个评估单元的序列,其中每个单元 \(\hat{u}_i\) 包含多个连续词元。这种分解通过边界索引 \(0 = j_0 < j_1 < \dots < j_{U_{\text{gen}}} = T_{\text{gen}}\) 定义了 \(\hat{\mathbf{y}}\) 的一个划分,使得 \(\hat{u}_i = (\hat{y}_{j_{i-1}+1}, \dots, \hat{y}_{j_i})\)。请注意,评估单元的数量 \(U_{\text{gen}}\) 可能因模型和温度参数而异。由真实值分解(见第3节)给出的每个位置 \(i\) 的参考单元被表示为 \(\mathbf{u}_i\),而生成的单元保持为 \(\hat{u}_i\)。我们将任务特定的答案表示为 \(\mathbf{y}_{\text{gt}}\),这是由上下文 \(\mathbf{x}_{\text{gt}}\) 生成的确定性真实值输出(其与输入的关系详见第3节)。这会产生相应的评估单元序列 \(\mathbf{u}=(u_1,\dots,u_U)\),其中 \(U\) 是真实值中评估单元的数量。为了在真实值和生成序列之间建立对应关系,我们使用了基于特定任务解析规则的确定性映射(详见第3节)。给定这种对应关系,我们将第 \(i\) 个生成单元的正确性 \(c_i\) 定义为其与相应真实值单元的精确匹配:\(c_i = \mathbb{I}[\hat{u}_i = u_i]\)。因此,第 \(i\) 个单元在且仅当其生成的词元与真实值词元完全相同时才被视为正确。某些任务允许多个有效真实值;这通过使用通配符模式在词元级别解析来处理(参见附录D.1)。这种严格的规则确保了零噪声的标签,对于可靠的不确定性评估至关重要。

## 3 SALT基准

我们介绍了单答案原子长文本目标(SALT)基准,专门设计用于在长文本生成中对不确定性估计进行零噪声评估。我们的关键设计原则是每个输入都有一个唯一已知的真实值输出,通过利用确定性结构作为地面真实值,消除了对不完美评判者的需求。SALT基准包含六个程序化生成的任务:矩阵乘法、网络搜索、翻译、编织-4、MultiQA和代码生成。表1总结了关键概况,附录D包含了所有任务描述和示例。

表1:SALT任务概要。“格式”面板指定了下限(原子单元)和上限(行单元)粒度。“空间”表示生成的编码-解码序列空间。“# 真实值单元”是每个分支中真实值单元的数量;“# 分支”是答案行。矩阵乘法、代码(分支)具有粗粒度结构;翻译具有可变结构。

| 任务 | 格式 (原子 → 行) | 空间 | # 真实值单元 | # 分支 |
| :--- | :--- | :--- | :--- | :--- |
| 矩阵乘法 | 元素 → 行 | 矩阵元素 | \(k\)  | \(k\)  |
| 网络搜索 | 结果 → 数据库 |  搜索结果 | \(n\)  | \(n\)  |
| 翻译 | 词符 → 句子 | 词符 | 可变 | 可变 |
| 编织-4 | 编辑 → 行 | 编辑操作 | 40 | 4 |
| MultiQA | Q-A对 → 行 | Q-A对 | \(n\) | 1 |
| 代码 (分支) | 表达式 → 行 | 代码行 | \(n\) | \(n\) |

**程序化真实值生成。** 每个SALT任务都使用程序化、确定性的函数生成其输入-真实值对。对于每个任务,一个程序以(可选)种子、一组参数和一个难度级别作为输入,并产生一个唯一的输入和真实值输出。输入和真实值输出都完全由确定性规则决定。关键的是,输入和真实值之间的关系是已知的,并且完全由任务函数指定。在生成过程中,LLM接收相同的输入,其输出与已知真实值进行逐单元比较。

**评估单元。** 真实值被分解为粒度明确的评估单元。表1(格式面板)列出了每个任务的原子和行级单元。通常,原子单元是最小的自然语义单元(例如,矩阵元素、翻译中的词符、代码中的位置),而行单元是结构化的、以换行符分隔的分组(例如,矩阵行、代码行)。

**确定性对应关系。** 评估需要将生成的单元与真实值单元对齐。关键的是,这种对齐对于所有模型都是确定性的:我们假设模型以与真实值完全相同的结构化方式输出其单元。具体来说,每个任务强制执行两个约束:(i)评估单元的数量及其相对顺序在真实值和生成之间是固定的;(ii)单元在生成的输出中以与真实值相同的方式分隔。这些约束在提示词中通过结构化格式说明(在矩阵乘法中使用换行符和空格,在翻译中使用行中断)传达给模型。这使得我们能够直接在单元级别进行逐点比较,无需任何配对搜索或模糊匹配。如果响应包含错误数量的单元(例如,在矩阵中生成额外的行),则生成被视为无效并被放弃。这种严格的要求确保了评估的完全确定性,并消除了外部判断,是SALT作为无噪声基准的核心。

**无污染评估。** SALT任务是完全程序化且参数化的,允许生成任意数量的新实例。具体来说,生成器可以使用随机种子,确保每次运行都产生唯一的实例。这意味着这些实例在标准LLM的训练数据中不可能出现,从而保证了一个无污染的评估环境。这从当前和未来的评估中消除了基准污染的风险。

**链式推理。** 对于所有任务,我们使用提示词要求模型逐步推理,然后给出最终答案。我们在提示词中隔离最终答案之前用一个特殊的词元(\boxed{})标记,确保我们评估的正是结构化输出。中间推理词元在评估期间被忽略。

**任务描述。** 每个任务通过利用确定性结构作为地面真实值来促进无噪声评估。例如,矩阵乘法任务要求计算 \(m \times n\) 和 \(n \times p\) 矩阵的乘积。真实值是确定性的,模型必须以换行符分隔行的格式输出结果矩阵。类似地,对于代码生成,需要评估器表达式的值;翻译是将每种语言的每个单词或短语逐行映射;编织-4模拟交错重写操作,每个操作都是确定性的;MultiQA桥接了多个检索查询;而网络搜索涉及确定性键值对查询。附录D提供了每个任务的完整描述。

**评估指标。** 我们使用对数概率、熵、简洁度和在提示词中直接要求的口头置信度作为不确定性分数。对于排序,我们使用AUROC和优先召回曲线(PRC)。对于校准,我们使用期望校准误差(ECE)和适应性校准误差(ACE)。详见附录A。

## 4 实验

### 4.1 主要结果:不确定性估计方法的比较

**研究问题1:哪种不确定性函数在长文本生成的不同粒度上主导排序和校准?**

我们比较了多种不确定性函数。表2报告了不同粒度的汇总结果。

表2:不确定性指标在不同模型类型(指令与推理)和粒度(原子与行)上的AUROC和ECE。黑体表示最佳值,下划线表示次佳值。AUROC针对任务汇总,而ECE在每个任务上计算以保持校准。

| 函数 | AUROC (原子) | ECE (原子) | AUROC (行) | ECE (行) |
| :--- | :--- | :--- | :--- | :--- |
| **指令调优模型** |
| 熵 | 0.57 | 0.12 | 0.63 | 0.10 |
| 简洁度 | 0.55 | 0.20 | 0.62 | 0.15 |
| 口头置信度 | 0.60 | 0.25 | **0.68** | 0.18 |
| 对数概率 (平均) | **0.62** | **0.08** | 0.65 | **0.06** |
| **推理模型** |
| 熵 | 0.56 | 0.14 | 0.62 | 0.11 |
| 简洁度 | 0.54 | 0.22 | 0.61 | 0.17 |
| 口头置信度 | 0.59 | 0.27 | 0.66 | 0.20 |
| 对数概率 (平均) | **0.61** | **0.09** | 0.64 | **0.07** |

在原子级别的排序(AUROC)方面,平均对数概率始终表现最佳,但绝对性能较低(AUROC ~0.62)。口头置信度在行级别排序上表现出竞争力(AUROC ~0.68)。在原子级别,所有函数都表现出较差的分离能力,这表明在细粒度上排序是一个挑战。在原子级别,校准主要由平均对数概率主导(ECE ~0.08-0.09),而口头置信度显示出最高的校准误差。推理模型在原子校准上略优于指令模型,但在AUROC上表现相似。

图3进一步分解了每个任务和粒度的结果。原子级AUROC(图3a)对于所有函数通常都低于0.7,但在任务间存在显著差异。行级性能(图3b)显示出更大的方差,口头置信度在某些任务上匹配或超过对数概率。

参考图注 图3:按任务和粒度划分的AUROC,汇总于所有模型。虚线表示随机猜测基线AUROC = 0.5。

**发现1:置信度排序在原子分辨率下基本上失败,即使更粗粒度的排序仍具有信息量。** 所有不确定性函数在原子单元上区分正确与错误的能力有限,而对于行单元则显示出更清晰的分离。这种差距不是由于校准不足造成的,而是因为局部(单元级)的置信度信号不能可靠地分离局部正确性,即使全局输出在更粗粒度上是可分离的。如第4.3节的分析所示,行级聚合主要平滑了这种噪声。

### 4.2 推理权衡:准确性对排序和校准的损害

**研究问题2:推理(CoT/推理模型)如何影响不确定性估计?**

我们比较了使用CoT和推理模型与标准指令调优模型的准确性、AUROC和ECE。表3报告了编码和解码空间的这些指标。

表3:推理(CoT/推理模型)对准确性和不确定性指标的影响,在编码和解码空间分开报告。所有指标都针对原子级正确性报告。箭头指示期望方向:↑更好,↓更差。

| 模型类型 | 编码准确性 ↑ | 解码准确性 ↑ | 原子AUROC ↑ | 原子ECE ↓ |
| :--- | :--- | :--- | :--- | :--- |
| 指令调优 | 71.2% | 69.8% | 0.62 | 0.12 |
| 推理 (CoT) | 68.4% | 72.5% | 0.60 | 0.14 |
| 推理 (推理模型) | 78.1% | 84.3% | 0.61 | 0.09 |

图4显示了配对差异分布。指令模型在编码正确性上表现更好,而推理模型在解码上表现更好。推理模型也提高了原子校准(ECE从0.12降至0.09)但AUROC略有下降。

参考图注 图4:推理对不确定性指标的影响均值差异。错误条是95% CI。

**发现2:推理机制(CoT/推理模型)引入了一个“推理权衡”,在提高解码准确性的同时系统性地损害了置信度排序。** 这种权衡部分源于推理输出中更大的一致性,这压缩了置信度分布,破坏了区分细微正确性差异的能力,即使它提高了正确性。

### 4.3 生成过程中正确性的动态变化

**研究问题3:未来正确性如何受到先前正确性和输出长度的影响?**

通过生成过程中的原子级干预,SALT使我们能够分析这些动态。图5和6分别显示了局部和全局先前正确性对未来正确性的影响,以及上下文的长度。

参考图注 图5:局部Δ(前一原子)对未来原子正确性的影响。

参考图注 图6:全局上下文正确性对未来正确性的影响。

**发现3:未来正确性有两个可分离的驱动因素:(a)来自受损前缀的传播(受全局而非局部上下文正确性主导),以及(b)由于增加的答案上下文长度而导致的有界退化。** 受损前缀的影响,尤其是全局上下文正确性,强烈地预示了未来的错误,即使在局部正确性得到控制的情况下。局部(前一原子)正确性的边际效应要弱得多。答案上下文长度的增加也单调地降低了正确性,在饱和之前。这些效应是可加的;即使当前缀完全正确时,最长的上下文也会对正确性施加一个天花板。

## 5 相关工作

**长文本中的不确定性估计。** 先前的工作主要集中在短文本生成或使用多项选择任务的句子级置信度(Xiong 等人,2023; Yin 等人,2023; Huang 等人,2023)。长文本基准如HaluEval(Li 等人,2023)和FateFul(Vashurin 等人,2025)引入了基于LLM的原子事实分解,引入了噪声(如附录I分析)。细粒度不确定性方法如METEOR(Malaviya 等人,2024)和实体级不确定性(Kuhn 等人,2023)使用分解但对于开放生成仍然依赖于外部验证。SALT通过确定性真实值避免了这种噪声。

**推理与不确定性。** 先前的工作已经注意到CoT可能会损害校准(Madaan 等人,2023; Zhang 等人,2024a)。我们的结果匹配这些发现,但揭示了原子级别上更微妙的权衡。

**生成动态。** 诸如上下文幻灭之类的现象在长文本中已经被注意到(Shi 等人,2023; Liu 等人,2024)。SALT的受控干预验证了这些效应,但分离了全局与局部的贡献。

## 6 结论

我们引入了SALT,一个用于长文本生成中零噪声细粒度不确定性评估的基准。通过50多个模型的大规模研究,我们揭示了关键发现:置信度排序在原子分辨率下失败,推理引入了一个权衡,驱动前缀的传播受全局上下文主导,以及基于长度的退化。SALT为未来不确定性方法提供了一个干净的基准。

**局限性。** SALT的任务是程序化且简化的;它们没有捕捉所有类型的真实世界幻觉(例如,基于现实世界上下文知识的幻觉)。然而,无噪声的设计对于开发改善在风险关键应用中的可靠性的方法至关重要。

## 附录A 评估指标

### A.1 正确性与不确定性

我们使用在主要论文中定义的确定性正确性标签 \(c_i\)。这使我们能够计算每个不确定性函数的A.2 AUROC、ECE和ACE。

### A.3 优先召回曲线(PRC)

我们遵循Andriushchenko 等人(2024)的PRC定义。

## 附录B 补充实验和表格

### B.1 置信度函数的完整比较

#### B.1.1 跨模型的原子AUROC

图9显示了所有模型在原子AUROC上的箱线图。跨模型熵的中位AUROC为0.57,对数概率为0.62,口头置信度为0.60。

#### B.1.2 行AUROC

图10显示了行AUROC。口头置信度的分布明显高于原子级别。

#### B.1.3 任务级别的分解

图3显示了任务级别的AUROC。

### B.2 推理权衡的详细分析

#### B.2.1 交叉验证

使用10折交叉验证重新运行了分析以确认稳健性。结果保持与表3相同的趋势。

#### B.2.2 任务级别的影响

推理对特定任务(代码、矩阵乘法)的AUROC损害更大,但对翻译的影响较小。

### B.3 生成动态

#### B.3.1 局部Δ:原子级的边际效应

我们使用逻辑回归拟合了局部Δ(前一原子正确性的变化)对当前原子正确性的概率的影响。局部Δ的边际效应很小(平均0.03,p < 0.001),与全局上下文正确性相比微不足道。

#### B.3.2 全局Δ:累积上下文正确性的影响

我们将前5个原子的平均正确性作为全局上下文正确性的代理。这强烈预测了未来正确性(系数0.45,p < 0.001。

#### B.3.3 长度退化

对答案长度的二次拟合显示了一个饱和渐近线(在约100个单元长度时,概率降至0.15以下)。

## 附录C 基准模型

表6提供了所有55个模型的全面列表,包括参数、类型和来源。

| 模型 | 组织 | # 参数 | # 活跃 | 类型 | 来源 |
| :--- | :--- | :--- | :--- | :--- | :--- |
| Nemotron-Nano-9B-v2 | NVIDIA | 9B | 9B | 指令调优 | 开源 |
| Nemotron-Nano-12B-v2 | NVIDIA | 12B | 12B | 指令调优 | 开源 |
| Nemotron-3-Nano-30B-A3B-BF16 | NVIDIA | 30B | 3B | 指令调优 | 开源 |
| K2-V2-Instruct | LLM360 | 65B | 65B | 推理型 | 开源 |
| MiniMax-M2.1 | MiniMax | 230B | 10B | 推理型 | 开源 |
| MiniMax-M2.5 | MiniMax | 230B | 10B | 推理型 | 开源 |
| GLM-4.7-Flash | Z.ai | 31B | 31B | 推理型 | 开源 |
| GLM-4.7-FP8 | Z.ai | 358B | 358B | 推理型 | 开源 |
| Gemma-3-1b-it | Google | 1B | 1B | 指令调优 | 开源 |
| Gemma-3-4b-it | Google | 4B | 4B | 指令调优 | 开源 |
| Gemma-3-12b-it | Google | 12B | 12B | 指令调优 | 开源 |
| ... | ... | ... | ... | ... | ... |

(完整表格省略)

## 附录D 任务描述

### D.1 矩阵乘法

### D.2 网络搜索

### D.3 翻译

### D.4 编织-4

### D.5 MultiQA

### D.6 代码生成

## 附录E 提示词

## 附录F 计算基础设施

## 附录G 超参数

## 附录H 完整结果

## 附录I 噪声标签对不确定性指标的影响

## 附录J 额外的粒度级别

相似文章

LGMT:基于逻辑的变形测试用于评估LLM推理可靠性

arXiv cs.AI

本文介绍了LGMT,这是一个利用一阶逻辑生成语义不变测试用例以评估LLM推理可靠性的框架。在六个LLM上的实验表明,LGMT暴露了静态基准遗漏的隐藏缺陷,提示评估应侧重于逻辑不变性下的鲁棒性。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。

量化LLM基准中的排名不确定性

arXiv cs.LG

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。