StabilityBench:大语言模型不稳定性基准测试

arXiv cs.LG 论文

摘要

StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。

arXiv:2607.20558v1 公告类型:新 摘要:AI 助手越来越多地部署在高风险场景中,如医疗保健或政府服务。然而,由于其强烈的上下文依赖性,它们在现实世界中的行为仍然难以理解。当前的评估协议遵循纵深防御范式,具有复合的安全防护层,从传统基准测试到实时或对抗性测试。这些基准测试在很大程度上仍然是静态和单轮的,这限制了它们捕捉对话设置中现实世界变异性的能力。我们提出了 StabilityBench,这是一个原则性、通用且与模型无关的基准测试操作符,它将单轮基准测试查询转化为多轮交互历史。StabilityBench 通过人口统计代理或谄媚诱饵注入逼真的用户模拟来增强现有基准测试,同时保留原始任务意图。我们将 StabilityBench 应用于四个基准测试,涵盖数学推理、健康问答和安全,并在这些条件下评估了九个大语言模型。我们的结果表明,在这些注入下,模型性能持续不稳定,在研究的四个基准测试中有三个出现了显著的性能下降。这些结果突显了静态评估的重要局限性,并推动了更真实的评估设置。为此,我们提出了 StabilityBench-Mini:一个保持规模的 StabilityBench 变体,沿多样化轴进行采样,使得在不增加成本的情况下实现更真实的评估。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:12

# 大型语言模型不稳定性基准测试框架

来源:https://arxiv.org/html/2607.20558

###### 摘要

AI 助手正越来越多地被部署在高风险场景中,例如医疗保健或政府服务。然而,由于强烈的上下文依赖性,它们在现实世界中的行为仍然难以理解。当前的评估协议遵循一种具有复合防护层的“纵深防御”范式,涵盖从传统基准测试到实时或对抗性测试。这类基准测试在很大程度上仍然是静态和单回合的,限制了它们捕捉会话设置中现实世界变异性的能力。我们提出了 StabilityBench,这是一个有原则、通用且与模型无关的基准算子,可将单回合基准查询转换为多回合交互历史。StabilityBench 通过注入逼真的用户模拟(通过人口统计代理或谄媚诱饵)来增强现有基准测试,同时保留原始任务意图。我们将 StabilityBench 应用于涵盖数学推理、健康问答和安全性的四个基准测试,并评估了九种大型语言模型在这些条件下的表现。我们的结果表明,在这些注入条件下,模型性能始终不稳定,在所研究的四个基准测试中有三个出现了相当大的性能下降。这些结果凸显了静态评估的重要局限性,并推动了更加真实的评估设置。为此,我们提出了 StabilityBench-Mini:StabilityBench 的一种规模保持变体,它跨多样化轴进行采样,从而在不增加成本的情况下实现更真实的评估。

大型语言模型,部署风险

## 1 引言

图 1:StabilityBench 算子概述。该算子通过跨各种社会人口统计代理特征的多回合交互模拟器以及一个诱饵模块(通过提示注入探测某些弱点)来转换基准测试。两个模块中的转换均通过设计保持语义不变性,从而保留基准测试作为评估工具的原始质量。

AI 助手的部署速度正以前所未有的速度加快。这些应用已包括高风险领域,例如 AI 工具在医疗保健(Kumpunen 等人,2025)和司法职业(经济合作与发展组织,2025)中的使用日益增加。¹¹¹ 将这些领域中的 AI 集成归类为高风险是基于众多科学报告(例如,参见 Bengio (2025))和立法框架(例如,参见欧盟 AI 法案第 6 条、附件 III (Union, 2024) 或科罗拉多州《与人工智能系统交互中的消费者保护法》(Assembly, 2024))中的评估。

为了安全部署,这些模型需要稳定且一致的行为模式;然而,有许多迹象表明,在现实世界的模型部署中存在着巨大(且通常是无法预见的)变异性(Amodei 等人,2016;Sharma 等人,2024;Vinay,2025)。当现实世界的行为与训练和评估环境不同时,AI 系统不仅可能表现不佳,而且还可能自信地表现并漂移到不期望的方向(Amodei 等人,2016;Vinay,2025)。

前沿模型通常在一系列基准测试上进行评估,每个基准测试在特定领域或任务内引出了能力(Hudson 等人,2021);范围从基础推理能力(Hendrycks 等人,2023;美国数学协会,2025)到更高风险的领域,如医疗保健问答(OpenAI,2025b)。安全护栏日益成为这些评估协议的重要组成部分;专注于压力测试此类护栏的基准测试被广泛用于前沿模型(OpenAI,2025a)。替代性评估设置也正在出现,例如人工主导的红队演练(Mazeika 等人,2024)或准实时评估(Chiu 等人,2024;Lyu 等人,2024)。

虽然在开发代表模型跨领域性能的评估协议方面已经做出了重要的努力,但当前的基准测试仍未考虑与 AI 助手现实世界交互的关键方面。这些包括用户画像(模型对用户的感知如何影响其响应)和用户行为(用户的提示如何影响模型响应)方面的用户依赖变异性。此外,用户-助手交互的对话性质使得纵向现象得以发生,这是单回合基准测试无法解释的。在多回合对话中,模型可能会丢失嵌入在长上下文中的信息,并保留用户特定信息的细微部分,甚至推断和保留人口统计特征(Liu 等人,2023;Staab 等人,2024;Panda 等人,2025)。这种纵向行为转变可能被忽视,尽管有理由预期单回合行为转变(现在已经得到彻底研究,从子群体转变到提示敏感性)也会发生,甚至可能在多回合设置中被转化或放大。对此类漂移的鲁棒性需要在纵向设置中运行的实际部署前验证框架。

学者们已经呼吁制定能够做到这一点并超越单一提示模板的评估协议(Mizrahi 等人,2024)。我们在此提出 StabilityBench,这是首个能够将现有单回合基准测试转换为多回合交互集的基准算子。该算子通过设计保持任务不变,并通过原则性的用户特征轴增强查询。出于本基准算子的目的,我们提出了一个多回合交互模拟器,该模拟器模拟以用户角色为条件的多回合对话,这些用户角色基于社会人口统计和社会经济因素的代理。然后,诱饵模块类似地将查询转换为带诱饵的变体。诱饵是注入的提示片段,可以预期分散模型的注意力,或将其引导到最正确或最真实方向之外的方向。它们从奉承诱饵到上下文注入(Sharma 等人,2024)不等。

我们评估了 9 种大型语言模型 (LLM) 在 AIME(美国数学协会,2025)、GSM8k(Cobbe 等人,2021)、HealthBench(OpenAI,2025b)和 StrongReject(Souly 等人,2024)这些基准测试的增强版本上的表现。这些是广泛应用于前沿模型的 4 个单回合基准测试。它们分别涉及数学推理、医疗问答和安全领域。我们评估的模型包括来自 4 个模型系列(GPT-5(OpenAI,2025a)、Gemini 2.5(Gemini 团队,Google,2025)、Gemini 3(Google,2025)和 Mistral 3(Mistral AI,2025a))的 3 个大模型和 6 个小模型。

在增强基准测试上,我们观察到相当高的查询率,这些查询在原始基准测试上模型回答正确,但在带诱饵的版本上回答失败:我们使用提出的“诱饵退化率”来量化这一现象。我们观察到由我们的多回合交互模拟器导致的相同现象,我们使用“模拟退化率”类似地进行量化。我们观察到更高的查询率,其中模型的答案完全翻转(任一方向,从正确到错误,反之亦然;我们使用类似的“翻转率”进行量化),这表明前沿模型存在高度不稳定性,而当前的评估框架未能揭示这一点。在高风险环境中,人口统计背景预计会真实出现,例如医疗保健问答,由社会人口统计代理特征引起的脆弱性尤其令人担忧。

## 2 AI 助手的不稳定行为

行为不稳定性已成为 LLM 评估研究的重点。前沿模型的不可预测性已通过一系列性质各异的经验发现得到证明。这种不稳定性表现为输出的系统性变化,这些变化通常不可预测,并且与预期的训练行为不一致。重要的是,它似乎甚至由于语义无关的因素而出现,表明脆弱性超出了标准分布变化(Li 等人,2025;Tosato 等人,2025);尽管 LLM 也被证明对这些传统变化敏感(Quiñonero-Candela 等人,2009;Ovadia 等人,2019)。特别是,群体转变(一种结构化的分布变化形式,其中与性能相关的变化发生在可识别的子群体之间)可以随着生成式 AI 呈现出新的维度(Rudner 等人,2024)。事实上,LLM 的生成性和通用性引入了更广泛和更微妙的变化。下面,我们引出两个不同的因素,每个因素都在这些变化中起作用。理想情况下,这些问题应该得到解决,并且部署的 AI 系统应具有可预测和一致的行为;缺乏这种保证在高风险领域很容易变得危险。

#### 对用户行为的依赖

前沿模型在遵循各种探测机制时已显示出普遍的不一致性。提示结构、顺序或语法上的细微变化可能导致显著不同的输出,证明了高度敏感性,这可能会破坏可靠性(Chatterjee 等人,2024;Ismithdeen 等人,2025;Tosato 等人,2025)。前沿 AI 模型也可能为了迎合用户的信念或偏好(Perez 等人,2022;Sharma 等人,2024),或面对长上下文时(Liu 等人,2023),而损害信息准确性。即使是通常预期能稳定行为的干预措施,如推理或包含对话历史,也已显示在某些设置中增加了变异性(Tosato 等人,2025)。

#### 对用户类型的依赖

重要的是,性能不仅取决于用户行为,还取决于用户类型。Akpinar 等人(2025)表明,系统也会根据查询中嵌入的角色线索损害信息准确性。关于 LLM 中偏见的文献也广泛记录了这种现象。这些行为漂移在高风险 AI 应用中尤其有害。例如,用于医疗保健环境(无论是患者还是从业者辅助)的 AI 系统已被证明过度代表与疾病相关的刻板印象(Zack 等人,2024),或根据人口统计特征改变紧急程度排序(Omar 等人,2025)。这些差异对于交叉身份群体可能更强(Buolamwini,2024;Buolamwini 和 Gebru,2018;Omar 等人,2025)。现有工作特别表明,用户特征可以改变 LLM 提供的医疗建议的可及性,对某些交叉少数群体产生特定和系统的负面影响(Kondrup 和 Imouza,2025)。

### 2.1 前沿评估方法

基准测试长期以来一直是 LLM 评估协议的核心。这些通常是特定领域或任务内的静态评估集,遵循单一提示模板(Mizrahi 等人,2024)。例如,AIME(美国数学协会,2025)是一组奥林匹克级别的数学推理问题。它测试模型执行多步问题解决、逻辑推理和符号操作的能力。类似的基准测试存在于各个领域,例如评估健康相关推理能力(OpenAI,2025b)或护栏鲁棒性(Souly 等人,2024)。这些基准测试有助于量化和验证模型在特定范围(领域或任务)内的性能;然而,它们存在固有的局限性,使其作为独立的评估范式不够充分(Mizrahi 等人,2024)。

因此,前沿模型评估在近年取得了巨大发展,朝着动态和对抗性评估范式的努力日益增多。例如,现在经常聘请专家对抗团队来发现潜在的模型漏洞,包括内部和独立(例如 FAR AI)。自动化红队框架也已出现,用于生成具有上下文和对抗性扰动的类似定向攻击,从而压力测试模型鲁棒性,特别是在安全领域(Chiu 等人,2024;Mei 等人,2023;Jindal 等人,2025)。这些框架向多回合范式的转变正在取得进展(Ge 等人,2023),但仍处于早期阶段。这些防御层各自探测某些薄弱区域,以共同抵御攻击。事实上,类似于错误信息或越狱等其他复杂问题,“纵深防御”方法可以是解决行为不稳定性的一种有吸引力的模型(McGuiness,2001)。这种范式假设没有单一解决方案可以解决给定问题,而是建立复合的防御层。这有时也被称为“瑞士奶酪模型”(Reason,1990

相似文章

量化LLM基准中的排名不确定性

arXiv cs.LG

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。