使用QQ等式审计大语言模型中的问题顺序效应:机制刻画与饱和警告
摘要
本文将从认知科学中提出的QQ等式发展为针对大型语言模型(LLM)的审计标准,刻画了理论上的机制类别,并在一个开源权重的指令微调模型上进行了实证测试,结果发现饱和(近确定性响应)阻碍了分布级审计。
查看缓存全文
缓存时间: 2026/07/21 06:44
# 审计大语言模型中的问题顺序效应:QQ 等式的机制刻画与饱和警示
来源:https://arxiv.org/html/2607.17219
Pilsung Kang
软件科学系,檀国大学
龙仁,韩国
pilsungk@dankook\.ac\.kr
###### 摘要
人类调查受访者表现出满足 QQ(量子问题)等式的问题顺序效应,该等式是投影量子问题顺序模型的一个先验、无参数预测。我们将 QQ 等式发展为自回归大语言模型(LLM)顺序判断的审计标准。理论上,我们刻画了哪些机制类能够鲁棒地满足它:边缘独立核满足 QQ 当且仅当所有四个失配转移率一致(该类别包含在状态变化下具有固定测量对的二维秩-1 投影模型);一个极性和位置依赖的重复族由一个精确的交叉对称条件表征,具有闭式违规;满足 QQ 的行为在顺序匹配混合下是封闭的;而秩-2 默认语境性准则转化为审计坐标中的 |q_QQ| ≤ OSS,其中 OSS(顺序敏感性分数)合计两个边缘的顺序敏感性。方法论上,我们开发了一个预指定、审计日志化的流程,适用于任何暴露下一个词元对数概率的模型;它结合了最坏情况鲁棒性包络、抽样一致性抽查、完整标签平衡和饱和诊断。实证上,在开放权重指令微调模型上的首次信号试点中,在两种框架下,所有预指定的健康门控均通过,但分别有 17/18 和 7/8 个项目对是饱和的(近乎确定性),且没有项目被认证为剩余语境性。因此,在测试模型和提示条件下,强制二选一的下一个词元对数概率不足以进行分布级 QQ 审计;我们建议每当将下一个词元分布视为调查响应分布时,使用预指定的饱和诊断。
## 1 引言
问题顺序会改变人类调查的答案,有时变化显著。在 1997 年 9 月进行的一项 Gallup 民意调查中,一半的受访者被问及 Bill Clinton 是否诚实可信,然后问及 Al Gore 同样的问题;另一半则按相反顺序回答这两个问题。当 Clinton 先被问及时,他的同意率为 50%,Gore 为 68%——相差 18 个百分点;当 Clinton 后被问及时,他的同意率升至 57%,而 Gore 降至 60%,差距缩小到 3 个百分点[1 (https://arxiv.org/html/2607.17219#bib.bib1),2 (https://arxiv.org/html/2607.17219#bib.bib2)]。这类顺序效应普遍存在且有充分记录,本身并不令人惊讶。令人惊讶的是其背后隐藏着一种更清晰的规律性。
Wang 等人 [3 (https://arxiv.org/html/2607.17219#bib.bib3)] 记录了在 72 个数据集中(主要是全国性实地研究,加上实验室实验),两个顺序条件下的联合分布满足 *QQ(量子问题)等式*
\[
q_{\mathrm{QQ}}:=\bigl[p_{AB}(A_{y},B_{n})+p_{AB}(A_{n},B_{y})\bigr]-\bigl[p_{BA}(B_{y},A_{n})+p_{BA}(B_{n},A_{y})\bigr]=0,
\]
其中 \(p_{AB}\) 和 \(p_{BA}\) 分别表示问题 A 先被问及和问题 B 先被问及时联合答案分布,\(A_{y}, A_{n}, B_{y}, B_{n}\) 表示每个问题的“是”和“否”答案。这是投影量子问题顺序模型的一个先验、无参数预测[相似文章
大型语言模型是否仔细审查其评审内容?对评分校准、错误检测和作者身份效应的多模态审计
本研究评估了两个多模态大型语言模型作为ICLR 2026投稿的同行评审,发现评分校准高但错误检测低,作者身份无影响,而图表降低了错误检测。
看似合理但实际无效:对LLM作为合成调查受访者的心理测量学审计
本文对大型语言模型作为合成调查受访者进行了心理测量学审计,发现它们无法匹配人类的联合分布和信度,因此不适合作为人类受访者的替代品。
本体增强蒸馏与情境性审计用于主权企业语言模型:一种结合机制验证与负面结果方法的研究
本文结合了机制验证研究,针对主权企业语言模型的本体增强蒸馏以及一种情境性审计方法,使用了经过监督微调和DPO适配的Qwen3.6-27B学生模型。结果统计功效不足且为负面,显示未优于前沿基线,且路由中情境性为零。
CompactQE: 通过小型开放权重LLMs实现可解释的翻译质量评估
本文证明,小型开放权重LLMs(参数小于30B)能够实现具有竞争力的可解释翻译质量评估,包括MQM错误标注和修正,与更大的专有模型相媲美,同时保护数据隐私。
Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges
A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.