参差的法官:沉默、压力与坚持下的认知稳定性

arXiv cs.AI 论文

摘要

本文介绍了 Wiggle 框架,这是一种针对 LLM 裁判认识论稳定性的统一压力测试,涵盖 14 项任务,衡量机械一致性、单轮信念与多轮持久性。研究发现,所有 9 个受研究的前沿模型在压力下都会大幅翻转判决,且成功的压力通常相对于基准真相而言具有净破坏性。

arXiv:2608.12645v1 公告类型:新 摘要:LLM 裁判已成为模型评估、在线评分和奖励建模的核心基础设施。裁判通常通过黄金数据上的准确率进行验证,但准确率很难说明它们在重新提示、质疑或持续反驳下是否稳定。我们引入了 *Wiggle Framework*,一个针对 LLM 裁判认知稳定性的统一压力测试框架。该框架从三个维度分解裁判的鲁棒性:机械一致性(重新提示和重新框架下的稳定性)、单轮信念(单次质疑下的稳定性)以及多轮持久性(持续或自适应压力下的稳定性)。我们使用该框架研究了 9 个前沿模型,涵盖 14 项评判任务,涉及安全性、毒性、AI 写作检测和政治回应评估。每个模型作为裁判都表现出显著的摇摆——在静态反驳下有 25–71% 的判决反转,在对抗性 LLM 说服者下则有 62–91%。关键的是,我们发现能够成功改变裁判判决的压力几乎总是相对于地面真相造成净破坏。除了框架本身,我们识别出基线陪审团多数强度是预测哪些条目会摇摆的最有效的单次信号。综合来看,这是首次在评判语境下对机械性、从众性和可说服性测试进行同类交叉数据集比较。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:26

# 认知稳定性:在沉默、压力与坚持之下  
来源:https://arxiv.org/html/2608.12645

## 参差法官:沉默、压力与坚持下的认知稳定性

Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu, Khalid El-Arini

###### 摘要

LLM 法官已成为模型评估、在线评分和奖励建模的核心基础设施。法官通常通过金标准数据上的准确率进行验证,但准确率并不能说明它们在重新提示、质疑或持续对抗下是否稳定。我们引入了 **Wiggle Framework**,这是一个针对 LLM 法官认知稳定性的统一压力测试。该框架将法官稳健性分解为三个维度:**机械一致性**(在重新提示和重新表述下的稳定性)、**单轮信念**(在单次质疑下的稳定性)和**多轮坚持**(在持续或自适应压力下的稳定性)。我们使用该框架研究了 9 个前沿模型,涵盖 14 个评判任务,跨越安全性、毒性、AI 写作检测和政治回应评估。每个模型作为法官都表现出显著的摇摆——在静态对抗下 25–71% 的时间翻转裁决,而在对抗性 LLM 说服者面前则为 62–91%。关键的是,我们发现成功改变法官裁决的压力几乎总是相对于真实标签产生净腐蚀。除框架本身外,我们确定基线陪审团多数强度是预测哪些条目会摇摆的最有效的单次信号。综合来看,这是在评判语境下对机械性、从众性和可说服性测试的首次同类跨数据集比较。  
††所属机构:Meta Superintelligence Labs††所属机构:FAIR at Meta††日期:2026年8月12日††通讯作者:[[email protected]](mailto:[email protected])††网站:https://www.jagged-judges.com/

参见图注  
图1:The Wiggle Framework。每条轨迹都锚定在 L0,即温度为零、无压力条件下产生的第一个有效裁决。*机械一致性*以语义不变的方式重新尝试查询(基本重复、琐碎提示扰动、位置一致性)。*单轮信念*测量对一次脚本化质疑(L1–L4)的响应。*多轮坚持*将 L1–L4 持续 10 轮,并增加两个明确的多轮协议:循环执行 L1–L4(L5)以及由另一个 LLM 根据当前对话自适应生成每次质疑(L6)。[opposite] 是与 L0 相反的裁决,[argument] 是模型生成的论点(附录 G (https://arxiv.org/html/2608.12645#A7))。完整 L6 协议见附录 G.2 (https://arxiv.org/html/2608.12645#A7.SS2)。

## 1 引言

LLM 法官正日益处于模型开发栈中具有重要影响的决策点。它们为基准测试中的输出打分,在生产环境中对内容进行分类,并在训练、评分和优化前沿模型的循环中代替人类判断。标准验证流程是:策划一个由专家审核示例组成的金标准集,验证法官的裁决与这些标签具有合理的一致性,如果准确率足够就部署(Collot 等人 2025 (https://arxiv.org/html/2608.12645#bib.bib11))。这验证的是法官*平均而言*是否正确,但远远不能说明它是否*稳定*。如果再次被询问、被质疑或被反复施压,裁决还会保持不变吗?在每个裁决背后,隐藏着一个关于法官实际信念强度的分布。为了精确刻画法官的置信度,已有几种策略被提出:

- **直接询问。** 让 LLM 输出一个自报置信度分数(例如“你有多自信,0–100%?”)。研究表明,模型在过度自信方向上存在严重的校准偏差(Wei 等人 2024 (https://arxiv.org/html/2608.12645#bib.bib40))。
- **观察多次重复的一致性。** 使用重复答案的频率作为置信度的行为近似。这会大幅增加推理成本,同时继承了同样的过度自信问题(Wei 等人 2024 (https://arxiv.org/html/2608.12645#bib.bib40))。
- **检查裁决 token 的对数概率。** 如果裁决是第一个 token,其概率可以提供一种启发式置信度信号。推理模型在回答前会进行思考,而许多前沿 API 已不再暴露原始 token 概率,部分原因是这类输出可能助长模型提取攻击并泄露专有模型信息(Carlini 等人 2024 (https://arxiv.org/html/2608.12645#bib.bib6);Finlayson 等人 2024 (https://arxiv.org/html/2608.12645#bib.bib14))。

一个很大程度上独立的文献方向研究*谄媚*(sycophancy)和*可说服性*(persuadability):LLM 在对话压力下让步的倾向,这很可能是偏好优化的副作用(Perez 等人 2023 (https://arxiv.org/html/2608.12645#bib.bib28);Sharma 等人 2024 (https://arxiv.org/html/2608.12645#bib.bib34);Laban 等人 2023 (https://arxiv.org/html/2608.12645#bib.bib23))。然而,很少有工作探讨这些现象对理解或量化 LLM 在法官情境中的置信度意味着什么。我们引入了 **Wiggle Framework**,这是一个针对 LLM 法官认知稳定性的统一压力测试。它将法官置信度分解为三个基于行为的维度:*机械一致性*(在重新提示和语义不变的提示变化下的稳定性)、*单轮信念*(在单次实质性质疑下的稳定性)和*多轮坚持*(在持续或自适应压力下的稳定性)。我们将该框架应用于 9 个前沿模型,涵盖来自六个数据集的 14 个评判任务,跨越安全分类、毒性检测、红队测试、AI 写作检测和政治回应评估,并同时采用二值评分和李克特评分方案。所有被测模型作为法官都在所有数据集和评分方案下表现出显著的摇摆(图 2 (https://arxiv.org/html/2608.12645#S3.F2))。LLM 在压力下改变想法这一事实并不新鲜,但更令人惊讶的是翻转的*结构*:二值量表和李克特量表在相同条目上产生相反的方向倾向,而且当法官确实发生翻转时,相对于真实标签,翻转更常是腐蚀性的而非纠正性的。第 6

相似文章

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

锁定证据再做评判:冻结接口降低LLM-as-Judge评估质量

arXiv cs.CL

本文测试了在一次调用中生成证据并将其作为后续裁决的唯一输入(证据锁定)是否会改善或损害LLM-as-Judge评估。在24,000次判断中,他们发现,与结构化单次调用评判相比,证据锁定将人类偏好一致性降低了4到6个百分点,并增加了答案顺序不一致性。

忠实还是虚构?LLM评审中合理化偏见的因果框架

arXiv cs.CL

本文提出了一个因果框架,用于量化LLM评审中的合理化偏见,即判决和解释受非证据性线索而非底层文本的影响。该框架提出了线索干预、锚定度量以及Proof-Before-Preference缓解协议,展示了改进的线索不变性。