格式敏感性指数:令牌控制的提示包装器鲁棒性与模式合规性在LLM基准测试中
摘要
本文介绍了格式敏感性指数(FSI)和可解析性敏感性指数(PSI),用于量化不同提示包装器下LLM准确率的变化。通过涉及多个模型和任务的14万次生成实验,研究表明包装器的选择会显著影响得分,而解析失败是其中的关键驱动因素。
arXiv:2607.09665v1 公告类型:新
摘要:提示包装器通常仅在格式上有所差异,但它们足以改变模型分数,从而颠覆排行榜结论。我们在令牌控制协议下研究了这种方差,并引入了两个互补指标:格式敏感性指数(FSI),即由包装器选择引起的准确率范围;以及可解析性敏感性指数(PSI),即答案可解析性的相应范围。在跨越7个问答任务、5个包装器家族和4个参数规模从7B到72B的指令模型的14万次OpenRouter生成中,我们发现平均FSI在不同模型间变化超过30倍,且很大程度上由合规失败解释。固定效应回归表明,即使在控制了任务、模型和包装器后,可解析性仍然是准确率的强预测因子。我们认为,不报告包装器方差和合规性的准确率在统计上是脆弱的,并给出了基准测试和结构化输出部署的实用建议。
查看缓存全文
缓存时间: 2026/07/14 04:15
# 格式敏感性指数:大语言模型基准测试中令牌控制的提示包装器鲁棒性与格式合规性
来源:https://arxiv.org/html/2607.09665
###### 摘要
提示包装器通常仅在格式上有所差异,却足以改变模型得分,甚至颠覆排行榜结论。我们在一个令牌(token)控制协议下研究这种差异,并引入两个互补指标:格式敏感性指数(FSI,衡量包装器选择导致的准确率范围)和可解析性敏感性指数(PSI,衡量答案可解析性的相应范围)。通过对覆盖7个问答任务、5个包装器家族和4个指令微调模型(参数规模从7B到72B)的14万次OpenRouter生成结果进行分析,我们发现,不同模型的平均FSI差异超过30倍,且主要由合规性失败(compliance failures)解释。固定效应回归表明,即使在控制任务、模型和包装器后,可解析性仍然是准确率的强预测因子。我们认为,仅报告准确率而不考虑包装器差异和合规性在统计上是脆弱的,并为基准测试和结构化输出部署提供了实用建议。
## 1 引言
基准测试越来越多地通过包含包装器的提示来评估大语言模型(LLM):这些包装器包括分隔符、JSON指令、逐步模板等,它们本应是语义上无关的格式。但在实践中,包装器在论文、工具包或供应商之间很少标准化。这导致了一种方法论上的失败模式:一个模型可能因为包装器的不同而显得强大或弱小,而非其底层能力。
我们的实验暴露了一个极端例子。在同一组7个任务上,同一个模型在严格的JSON包装器下得分接近随机,而在基于分隔符的结构化包装器下却能达到超过0.75的准确率。这种差异并非微妙的提示技巧,而常常是一个合规性问题:如果输出无法被基准测试的答案提取器解析,则该次运行会被计为错误。
已有研究记录了少样本设置中对提示格式的敏感性(Sclar et al., 2024 (https://arxiv.org/html/2607.09665#bib.bib19); Chatterjee et al., 2024 (https://arxiv.org/html/2607.09665#bib.bib5))。然而,大多数基准测试流程仍为每个模型每个任务只报告一个数字,并且常常忽略在真实部署中占主导地位的结构化输出失败模式,包括工具调用、模式遵循和数据库查询。我们贡献了一种简单、可复现的方法,用于在类似常见评估实践的设置中量化由包装器驱动的差异。
#### 贡献
- **两个敏感性指标**。我们将FSI和PSI定义为由包装器引起的准确率和可解析性的范围,并报告自助法(bootstrap)置信区间以及一个归一化敏感性变体,以减少对平均准确率的依赖。
- **令牌控制评估**。我们实现了一个协议,将提示填充到固定的字符预算,记录实际提示令牌数量,并量化残留令牌分布。
- **大规模实证研究**。我们评估了4个指令微调模型,涵盖7个任务和5个包装器家族,共产生14万次生成结果,并表明格式敏感性在不同模型之间存在显著差异。
- **机制分析**。我们通过相关性和固定效应回归表明,可解析性在准确率差异中起到重要的中介作用。
## 2 相关工作
#### 提示格式敏感性
LLM可能对保持语义不变的提示变化(包括格式)表现出脆弱性(Sclar et al., 2024 (https://arxiv.org/html/2607.09665#bib.bib19); Chatterjee et al., 2024 (https://arxiv.org/html/2607.09665#bib.bib5))。PromptBench研究了对抗性提示鲁棒性(Zhu et al., 2023 (https://arxiv.org/html/2607.09665#bib.bib23)),综述类文献则梳理了更广泛的评估风险(Chang et al., 2023 (https://arxiv.org/html/2607.09665#bib.bib4))。我们的设置更窄但更常见:指令遵循、单轮问答,以及旨在仅改变输出格式的包装器。
#### 基准测试方法论
诸如HELM等评估框架强调标准化和透明度(Liang et al., 2022 (https://arxiv.org/html/2607.09665#bib.bib13))。诸如lm-evaluation-harness等工具包为基准测试执行提供了共享接口(EleutherAI, 2024 (https://arxiv.org/html/2607.09665#bib.bib9))。我们的结果表明,包装器选择是应随解码设置和数据集预处理一同追踪的另一个差异轴。
#### 结构化输出与约束解码
生产系统越来越需要模式遵循。基于提示的JSON指令是脆弱的,这推动了约束解码和语法方法的发展(Geng et al., 2023 (https://arxiv.org/html/2607.09665#bib.bib11); Ugare et al., 2024 (https://arxiv.org/html/2607.09665#bib.bib21); Park et al., 2024 (https://arxiv.org/html/2607.09665#bib.bib15); Poesia et al., 2022 (https://arxiv.org/html/2607.09665#bib.bib16))。API提供商也提供了结构化输出模式,可在解码时强制执行JSON有效性或模式约束(OpenAI, 2024 (https://arxiv.org/html/2607.09665#bib.bib14); Anthropic, 2024 (https://arxiv.org/html/2607.09665#bib.bib2))。我们的工作通过衡量当要求结构化但未强制执行时,分数差异会有多大,来补充这些努力。
## 3 实验设置
### 3.1 任务与模型
我们评估了7个广泛使用的问答式基准测试,涵盖布尔型、多项选择和数值型答案:BoolQ(Clark et al., 2019 (https://arxiv.org/html/2607.09665#bib.bib6))、PIQA(Bisk et al., 2020 (https://arxiv.org/html/2607.09665#bib.bib3))、ARC-Challenge(Clark et al., 2018 (https://arxiv.org/html/2607.09665#bib.bib7))、HellaSwag(Zellers et al., 2019 (https://arxiv.org/html/2607.09665#bib.bib22))、WinoGrande(Sakaguchi et al., 2020 (https://arxiv.org/html/2607.09665#bib.bib18))、CommonsenseQA(Talmor et al., 2019 (https://arxiv.org/html/2607.09665#bib.bib20))和GSM8K(Cobbe et al., 2021 (https://arxiv.org/html/2607.09665#bib.bib8))。每个任务我们采样200个示例。我们测试了四个通过OpenRouter访问的指令微调模型:Mistral-7B-Instruct-v0.3(Jiang et al., 2023 (https://arxiv.org/html/2607.09665#bib.bib12))、Gemma-2-9B-IT(Gemma Team, 2024 (https://arxiv.org/html/2607.09665#bib.bib10))、Phi-4(Abdin et al., 2024 (https://arxiv.org/html/2607.09665#bib.bib1))和Qwen-2.5-72B-Instruct(Qwen Team, 2024 (https://arxiv.org/html/2607.09665#bib.bib17))。这组模型有意混合了从7B到72B的规模。我们在结论中将规模视为一个混淆因素,并在第7节(https://arxiv.org/html/2607.09665#S7)中讨论。
### 3.2 提示包装器
包装器是一个模板,它包围相同的任务内容(包括问题和选项),但改变格式和输出约束。我们评估了五个包装器家族:(1)plain,仅包含最小指令;(2)json,严格的JSON格式,带answer字段;(3)structured,键值对字段;(4)structured_delim,键值对字段加显式分隔符令牌;(5)deliberate,草稿纸加最终答案字段。典型片段见表1(https://arxiv.org/html/2607.09665#S3.T1);完整模板总结在附录A(https://arxiv.org/html/2607.09665#A1)中。
**表1:典型包装器片段。任务内容在所有包装器中保持不变。我们仅解析最终答案字段。**
| JSON | 带分隔符的结构化 |
|------|----------------|
| 返回一个JSON对象:{"answer": ...} 无额外键。无markdown。 | answer: ... |
### 3.3 令牌控制协议
包装器在表面长度上存在差异,这会改变提示令牌数量并可能影响准确率。为减少这一混淆因素,我们通过在包装器特定的填充槽中插入空白字符,将每个提示填充到每个任务固定的字符预算。然后,我们记录每个请求实际使用的提示令牌数。对于每个任务、模型、示例和随机种子,我们计算包装器之间的相对提示令牌分布:
\[
\Delta_{\mathrm{tok}}=\frac{\max_{f}T_{f}-\min_{f}T_{f}}{\frac{1}{|F|}\sum_{f}T_{f}},
\tag{1}
\]
其中 \(T_f\) 是包装器 \(f\) 下的提示令牌数。由于分词器对不同空白字符的分词方式不同,该协议并不能完全等化令牌数。因此,我们报告全量数据集的结果,以及一个按 \(\Delta_{\mathrm{tok}}\leq 5\%\) 过滤后的匹配子集的结果。
### 3.4 解码与采样
对于每个模型、任务和包装器,我们使用5个独立随机种子对200个示例生成答案,每个单元产生1000次生成,共140个单元。我们设置 max_tokens=24 并记录完成长度。其他解码参数在所有包装器中保持不变。在整个数据集中,42.3% 的任务、模型、包装器和示例组在五个种子上产生多于一个不同的预测,因此我们将种子视为随机重复。
### 3.5 答案提取、准确率与可解析性
我们使用任务感知的提取方法,将每个模型输出映射到规范答案字符串。无法映射的输出标记为不可解析,并计为错误。准确率是所有生成中0/1正确性指标的平均值。我们还计算可解析性,即具有有效提取答案的生成比例。附录B(https://arxiv.org/html/2607.09665#A2)报告了严格提取与归一化提取的变体。
## 4 敏感性指标
设 \(A_{m,t,f}\) 为模型 \(m\) 在任务 \(t\) 下使用包装器 \(f\) 的准确率,设 \(P_{m,t,f}\) 为可解析性。我们定义:
\[
\begin{aligned}
\mathrm{FSI}(m,t) &= \max_{f} A_{m,t,f} - \min_{f} A_{m,t,f}, \\
\mathrm{PSI}(m,t) &= \max_{f} P_{m,t,f} - \min_{f} P_{m,t,f}.
\end{aligned}
\tag{2}
\tag{3}
\]
FSI是一个范围统计量,可能对噪声敏感。因此,我们报告自助法置信区间和一个归一化变体:
\[
\mathrm{nFSI}(m,t)=\frac{\mathrm{FSI}(m,t)}{\frac{1}{|F|}\sum_{f}A_{m,t,f}+10^{-6}}.
\tag{4}
\]
## 5 结果
### 5.1 格式敏感性在不同模型之间差异显著
图1(https://arxiv.org/html/2607.09665#S5.F1)总结了各任务的平均FSI和PSI。Qwen-2.5-72B几乎对格式不敏感,平均FSI为0.024,95%置信区间为[0.014, 0.035];而Phi-4高度敏感,平均FSI为0.763,置信区间为[0.607, 0.872]。归一化敏感性进一步加剧了这一对比:Phi-4的平均nFSI为2.37,置信区间为[2.19, 2.63],表明包装器选择可以主导平均得分。表2(https://arxiv.org/html/2607.09665#S5.T2)报告了所有值。
**图1:各任务平均FSI和PSI,以及基于10,000次重采样跨任务的自助法置信区间。不同模型的平均FSI差异超过30倍。**
**表2:各模型敏感性摘要,宏平均于7个任务。报告平均FSI、PSI和nFSI,附带跨任务的95%自助法置信区间。**
### 5.2 可解析性解释了包装器差异的很大一部分
在140个模型、任务和包装器单元中,准确率与可解析性之间存在强相关,Pearson \(r=0.825\)。图2(https://arxiv.org/html/2607.09665#S5.F2)显示,当可解析性崩溃时,准确率通常很低。这在请求刚性结构的包装器中尤为突出。例如,在JSON包装器下,Phi-4有85.3%的生成以markdown代码块开头,导致可解析性仅为2.8%,准确率仅为0.7%。
相关性本身并不能确立中介作用。因此,我们在单元层面拟合了一个加权最小二乘回归:
\[
A_{m,t,f} = \beta P_{m,t,f} + \alpha_m + \gamma_t + \delta_f + \epsilon,
\tag{5}
\]
并加入了模型 \(m\)、任务 \(t\) 和包装器 \(f\) 的固定效应。可解析性仍然是一个强预测因子,\(\hat{\beta}=0.819 \pm 0.034\),并解释了相当部分的残差方差,偏 \(R^2=0.82\)。这支持了一个实际论断:许多由包装器引起的得分变化是由输出是否可被机器消费所驱动的。
**图2:所有模型、任务和包装器单元中准确率与可解析性的关系。较低的可解析性通常意味着接近零的准确率。**
### 5.3 哪个包装器获胜最多
包装器选择并非纯粹的合规性权衡。有些包装器即使在可解析性已经很高的情况下也能提高准确率,这表明格式也可能影响推理过程。图3(https://arxiv.org/html/2607.09665#S5.F3)统计了每个模型和任务中哪个包装器取得了最高准确率。基于分隔符的结构化包装器获胜次数最多,在28个组合中赢了12次,但deliberate和structured包装器也有不小的获胜次数。这支持报告包装器上的分布,而非选择单一最佳格式。
**图3:28个模型和任务组合中包装器的获胜次数。**
### 5.4 令牌控制与残留令牌分布
我们的填充协议减少了但并未消除提示令牌差异。在所有任务、模型、示例和种子组中,中位相对令牌分布为4.1%,61.2%的组满足 \(\Delta_{\mathrm{tok}}\leq 5\%\)。图4(https://arxiv.org/html/2607.09665#S5.F4)显示了分布情况。至关重要的是,结论在匹配子集上保持稳定:全量数据集上的平均FSI为0.391,而在按 \(\Delta_{\mathrm{tok}}\leq 5\%\) 过滤后为0.394。
**图4:在等化字符预算填充后,包装器间提示令牌分布 \(\Delta_{\mathrm{tok}}\) 的分布。**
## 6 讨论与建议
#### 基准测试报告
如果包装器选择可以使准确率变化0.76,那么大包装器差异的点估计值容易导致过度解读。我们建议基准测试论文和排行榜报告以下内容:(i)所使用的包装器家族,(ii)提示令牌数量,(iii)可解析率,(iv)一个考虑不确定性的敏感性指标,例如带置信区间的FSI。一个简单的替代方案是报告区间 \([\min_f A_{m,t,f},\max_f A_{m,t,f}]\) 以及平均值。
#### 结构化输出部署
当需要严格模式时,仅靠提示往往不够。如果下游消费者是脆弱的,那么可解析性崩溃可能主导测量的准确率。解码时约束,包括语法、模式约束解码或供应商结构化输出模式,可以构造性地降低PSI(Geng et al., 2023 (https://arxiv.org/html/2607.09665#bib.bib11); OpenAI, 2024 (https://arxiv.org/html/2607.09665#bib.bib14))。我们将FSI和PSI视为判断何时需要此类强制执行的诊断工具。
## 7 局限性
首先,FSI是一个范围统计量,可能受异常值和采样噪声影响。我们通过报告自助法置信区间和nFSI来缓解这一点,但更丰富的不确定性建模(例如示例和任务上的分层自助法)是未来的工作。其次,我们的令牌控制通过字符填充并记录提示令牌数,但并未严格等化令牌预算。更严格的控制可以截断或填充到每个包装器相等的令牌长度。第三,我们的模型集较小且混合了规模,因此鲁棒性可能反映规模和架构两方面。第四,我们专注于单轮问答任务;多轮工具使用和代码生成可能表现出不同的合规性动态。最后,解析器的严格程度很重要:我们报告了严格和归一化提取变体,但并未直接基准测试解码时强制执行或供应商JSON模式。
## 8 结论
提示包装器是LLM基准测试中一个报告不足的混淆因素。FSI和PSI量化了模型得分在多大程度上依赖于包装器选择,以及这种依赖是否由模式合规性驱动。相似文章
基于交互的LLM提示敏感性评估与解释
本文介绍了一种基于交互的提示敏感性 (IPS) 指标,通过分析交互来评估和解释大语言模型中的提示敏感性。该指标应用于50个开源LLM,识别了如微调和模型规模等因素通过低阶交互降低敏感性。
超越提示工程:提示词法敏感性的系统性分析及其对质量的影响
本文对大型语言模型中的提示词法敏感性进行了大规模分析,揭示了提示性能稳定性的缩放定律,并引入了一个自动化的Prompt-Refining Agent,以减少代码生成等任务中的性能方差。
SyPS: 衡量大型语言模型中的提示词奉承敏感性
本文介绍了SyPS,这是一个用于评估提示变化如何影响大型语言模型奉承行为的框架,使用奉承提示敏感性评分(SPSS)。
PromptAudit:审计基于LLM的漏洞检测中的提示敏感性
PromptAudit是一个受控评估框架,通过隔离提示表述对基于LLM的漏洞检测的影响,发现思维链提示在整体性能上表现最佳,同时提示敏感性必须被视为一级系统属性。
SICI:一种语义-语用复杂度指数揭示LLM立场检测中的状态转变
介绍了SICI,一种七维诊断指标,用于评估LLM立场检测中的语义-语用复杂度,揭示了不同模型和提示策略中错误模式的状态转变。