形式主义陷阱:LLM-as-a-Judge 评估器是否在社会负载下被共识模仿所蒙蔽?

arXiv cs.CL 论文

摘要

本文引入了“智能体形式主义陷阱”和评估失调指数,展示了 LLM-as-a-Judge 系统如何被结构形式主义和共识模仿所误导,而非基于语义真相,基于跨多个领域的 22,500 条轨迹。

arXiv:2607.28641v1 公告类型:新 摘要:我们引入了\textit{智能体形式主义陷阱}和评估失调指数($D_E$),用以量化 LLM-as-a-Judge 系统在对抗性负载下如何将结构程序性与语义真相混为一谈。通过分析 3 个领域(GAIA、SWE-bench、Multi-Challenge)中的 22,500 条轨迹,我们提取了幻觉策略的语义分类体系,并通过确定性词汇基准确认($p < 10^{-120}$)进行了验证。一个逻辑回归元评估器分离出这种评估器捕获的确切句法触发因素(ROC-AUC 0.8779),而零样本留一域外迁移则证明该漏洞具有普遍领域无关性(平均 ROC-AUC 0.7482)。架构剖析表明,不同的模拟群体拓扑结构会在数学上产生不同的语义盲区,证明无锚定的闭环评估是不稳定的、系统性发散的,并且需要针对特定架构的警戒过滤器。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:32

# 形式主义陷阱:LLM-as-a-Judge 评估器是否在社会性负载下被共识模仿蒙蔽?

来源:https://arxiv.org/html/2607.28641

Dahlia Shehata([email protected],滑铁卢大学,加拿大)与 Ming Li([email protected],滑铁卢大学,加拿大)

###### 摘要

我们引入了“代理式形式主义陷阱”(Agentic Formalism Trap)和评估失调指数 \(DED_E\),用以量化 LLM-as-a-Judge 系统在对抗性负载下如何将结构性的程序主义与语义真实性混为一谈。通过分析 3 个领域(GAIA、SWE-bench、Multi-Challenge)中的 22,500 条轨迹,我们提取了幻觉策略的语义分类体系,并通过确定性词汇锚定(\(p<10^{-120}\))进行验证。一个逻辑回归元评估器(logistic meta-evaluator)精确分离了这种评估器捕获的确切句法触发条件(ROC-AUC 0.8779),而零样本留一域外推(Leave-One-Domain-Out transfer)证明该漏洞是普遍的、与领域无关的(平均 ROC-AUC 0.7482)。架构剖析显示,不同的模拟群体拓扑会诱发数学上互不相同的语义盲区,证明无锚定的闭环评估并不稳定、具有系统性发散,并且需要针对特定架构的警惕过滤器。

# 形式主义陷阱:LLM-as-a-Judge 评估器是否在社会性负载下被共识模仿蒙蔽?

Dahlia Shehata([email protected],滑铁卢大学,加拿大)  
Ming Li([email protected],滑铁卢大学,加拿大)

## 1 引言

“LLM-as-a-Judge”范式([Zheng et al., 2023](https://arxiv.org/html/2607.28641#bib.bib34))的采用,已经使生成模型的可扩展、自动化评估标准化([Gu et al., 2026](https://arxiv.org/html/2607.28641#bib.bib3);[Dorner et al., 2025](https://arxiv.org/html/2607.28641#bib

相似文章

LLM-as-Judge的几何学:为何LLM间共识并非人类对齐

arXiv cs.CL

本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。

评判电路

arXiv cs.CL

本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。

忠实还是虚构?LLM评审中合理化偏见的因果框架

arXiv cs.CL

本文提出了一个因果框架,用于量化LLM评审中的合理化偏见,即判决和解释受非证据性线索而非底层文本的影响。该框架提出了线索干预、锚定度量以及Proof-Before-Preference缓解协议,展示了改进的线索不变性。