使用QQ等式审计大语言模型中的问题顺序效应:机制刻画与饱和警告

arXiv cs.CL 论文

摘要

本文将从认知科学中提出的QQ等式发展为针对大型语言模型(LLM)的审计标准,刻画了理论上的机制类别,并在一个开源权重的指令微调模型上进行了实证测试,结果发现饱和(近确定性响应)阻碍了分布级审计。

arXiv:2607.17219v1 公告类型:新 摘要:人类调查受访者表现出满足QQ(量子问题)等式的问题顺序效应,这是射影量子问题模型的一个先验、无参数预测。我们将QQ等式发展为自回归大型语言模型(LLM)顺序判断的审计标准。理论上,我们刻画了哪些机制类别能稳健地满足它:边际独立核满足QQ当且仅当所有四个不匹配转移率相等(该类包含在状态变化下具有固定测量对的二维秩1射影模型);一个极性和位置依赖的重复族通过一个精确的交叉对称条件及闭式违反来刻画;满足QQ的行为在顺序匹配混合下是封闭的;秩2的默认语境性标准转化为审计坐标中的 $|\qQQ|\le\OSS$,其中 $\OSS$(顺序敏感度分数)总计了两个边际的顺序敏感度。方法上,我们开发了一个预先指定、审计记录流水线,适用于任何暴露下一个标记对数概率的模型;它结合了最坏情况鲁棒性包络、抽样一致性抽查、完整标签平衡和饱和诊断。实证上,在一个开源权重指令微调模型的两个框架下的首次信号试点中,所有预先指定的健康检测均通过,但分别有17/18和7/8的项目对饱和(近确定性),且没有项目被认证为残留的语境性。因此,在测试模型和提示条件下,强制二选一的下一词元对数概率不足以进行分布级QQ审计;我们建议,只要将下一词元分布视为调查响应分布,就应使用预先指定的饱和诊断。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:44

# 审计大语言模型中的问题顺序效应:QQ 等式的机制刻画与饱和警示  
来源:https://arxiv.org/html/2607.17219  
Pilsung Kang  
软件科学系,檀国大学  
龙仁,韩国  
pilsungk@dankook\.ac\.kr  

###### 摘要  
人类调查受访者表现出满足 QQ(量子问题)等式的问题顺序效应,该等式是投影量子问题顺序模型的一个先验、无参数预测。我们将 QQ 等式发展为自回归大语言模型(LLM)顺序判断的审计标准。理论上,我们刻画了哪些机制类能够鲁棒地满足它:边缘独立核满足 QQ 当且仅当所有四个失配转移率一致(该类别包含在状态变化下具有固定测量对的二维秩-1 投影模型);一个极性和位置依赖的重复族由一个精确的交叉对称条件表征,具有闭式违规;满足 QQ 的行为在顺序匹配混合下是封闭的;而秩-2 默认语境性准则转化为审计坐标中的 |q_QQ| ≤ OSS,其中 OSS(顺序敏感性分数)合计两个边缘的顺序敏感性。方法论上,我们开发了一个预指定、审计日志化的流程,适用于任何暴露下一个词元对数概率的模型;它结合了最坏情况鲁棒性包络、抽样一致性抽查、完整标签平衡和饱和诊断。实证上,在开放权重指令微调模型上的首次信号试点中,在两种框架下,所有预指定的健康门控均通过,但分别有 17/18 和 7/8 个项目对是饱和的(近乎确定性),且没有项目被认证为剩余语境性。因此,在测试模型和提示条件下,强制二选一的下一个词元对数概率不足以进行分布级 QQ 审计;我们建议每当将下一个词元分布视为调查响应分布时,使用预指定的饱和诊断。  

## 1 引言  
问题顺序会改变人类调查的答案,有时变化显著。在 1997 年 9 月进行的一项 Gallup 民意调查中,一半的受访者被问及 Bill Clinton 是否诚实可信,然后问及 Al Gore 同样的问题;另一半则按相反顺序回答这两个问题。当 Clinton 先被问及时,他的同意率为 50%,Gore 为 68%——相差 18 个百分点;当 Clinton 后被问及时,他的同意率升至 57%,而 Gore 降至 60%,差距缩小到 3 个百分点[1 (https://arxiv.org/html/2607.17219#bib.bib1),2 (https://arxiv.org/html/2607.17219#bib.bib2)]。这类顺序效应普遍存在且有充分记录,本身并不令人惊讶。令人惊讶的是其背后隐藏着一种更清晰的规律性。  

Wang 等人 [3 (https://arxiv.org/html/2607.17219#bib.bib3)] 记录了在 72 个数据集中(主要是全国性实地研究,加上实验室实验),两个顺序条件下的联合分布满足 *QQ(量子问题)等式*  
\[
q_{\mathrm{QQ}}:=\bigl[p_{AB}(A_{y},B_{n})+p_{AB}(A_{n},B_{y})\bigr]-\bigl[p_{BA}(B_{y},A_{n})+p_{BA}(B_{n},A_{y})\bigr]=0,
\]
其中 \(p_{AB}\) 和 \(p_{BA}\) 分别表示问题 A 先被问及和问题 B 先被问及时联合答案分布,\(A_{y}, A_{n}, B_{y}, B_{n}\) 表示每个问题的“是”和“否”答案。这是投影量子问题顺序模型的一个先验、无参数预测[

相似文章

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

arXiv cs.CL

A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.