超越准确性:程序化痕迹如何改变LLM监督者的决策标准
摘要
本研究运用信号检测理论分析程序化痕迹如何影响LLM监督者,发现详细痕迹会使决策标准向拒绝方向偏移,并增加误报率。
arXiv:2609.18204v1 公告类型:新
摘要:组织越来越多地使用监督循环,其中一个大型语言模型(LLM)审计另一个的输出,并附带声称步骤的程序化痕迹。关于此类LLM作为评判者的流程,一个常见的担忧是详细痕迹会使监督者轻信。运用信号检测理论,我们对五个LLM监督者在19项合规任务(4,551个分析判断)上进行审计,仅变化痕迹细节和证据标签。在始终可见的反驳证据下,错误检测保持在接近上限的水平。相反,详细痕迹使决策标准向拒绝方向偏移,增加了易受影响的监督者的误报。在没有选项标签的情况下,经过人类验证的推理编码显示,约60%的误报将原因归结为无法将证据与其选项关联。标签消除了这一陈述的原因,但在这些监督者中,对正确工作的残留拒绝仍然存在,并且随着痕迹细节的增加而上升。因此,程序化痕迹作为治理制品,塑造监督决策。AI审计者应通过其决策标准和误报行为进行评估,同时考虑准确性。
查看缓存全文
缓存时间: 2026/09/17 09:11
# 程序化痕迹如何转变LLM监督者的决策标准 来源:https://arxiv.org/html/2609.18204 ## 超越准确性:程序化痕迹如何转变LLM监督者的决策标准 *致谢:预印本*。已被第60届夏威夷系统科学国际会议(HICSS,美国夏威夷)接收。 Zihan Chen 机构:史蒂文斯理工学院 地址:美国新泽西州霍博肯市 邮箱:[[email protected]](mailto:) Di Zhu 机构:史蒂文斯理工学院 地址:美国新泽西州霍博肯市 邮箱:[[email protected]](mailto:) Lei Zheng 机构:马萨诸塞大学波士顿分校 地址:美国马萨诸塞州波士顿市 邮箱:[[email protected]](mailto:) Weiling Li 机构:石溪大学 地址:美国纽约州石溪市 邮箱:[[email protected]](mailto:) ###### 摘要 组织越来越多地使用监督循环,其中一个大语言模型(LLM)审核另一个模型的输出及其声称步骤的程序化痕迹。关于此类“LLM即法官”流水线的一个常见担忧是,详细的痕迹会使监督者变得轻信。利用信号检测理论,我们对五个LLM监督者在19项合规任务(4,551次分析判断)上进行审计,仅改变痕迹细节和证据标记。当反证始终可见时,错误检测率保持在接近上限的水平。相反,详尽的痕迹会将决策标准向拒绝方向推移,增加易受影响的监督者的误报率。在没有选项标签的情况下,经过人工验证的推理编码显示,约60%的误报是由于无法将证据与其所描述的选项关联起来。标签消除了这一陈述的理由,但在那些监督者中,对正确工作的残留拒绝仍然存在,并且随着痕迹细节的增加而上升。因此,程序化痕迹作为治理工件,塑造了监督决策。AI审计者应通过其决策标准和误报行为,以及准确性来评估。 **关键词**:LLM即法官 ⋅ AI监督 ⋅ 信号检测理论 ⋅ 治理工件 ⋅ 自动化偏见 ## 1 引言 “让AI检查AI”已成为常见的安全措施。随着生成式系统进入高风险的知识工作领域,组织越来越多地尝试使用监督循环,由第二个LLM来判断、验证或审计第一个。这些流水线现在处理代码审查、内容审核、检索增强问答和合规审查,而“验证者”和“批评者”角色在多智能体工作流中被广泛采用[1]。其前提是自动化监督者可以扩展人类审查。组织采用这种安排是出于必要性,因为生成式系统产生工作的速度远快于人们检查的速度[2]。例如,GitHub Copilot用户完成任务的速度快约56%[3]。从组织的角度看,这个循环是一个自动化控制系统。附加在工作模型输出上的痕迹不仅仅是一个解释:它是后续控制决策的输入。然而,监督者的好坏取决于其判断,而这种判断又依赖于一个研究甚少的因素:与答案捆绑在一起的解释。当LLM监督者收到一个附带其得出过程说明的答案时,它会如何表现? 现代智能体系统返回的答案附带一个*程序化痕迹*。我们用这个术语指一种自然语言描述,呈现给监督者,声称工作模型分解了任务、检索并交叉核对了来源,并验证了其推荐[4]。一个简洁的餐厅推荐痕迹可能说明“我审查了标准,根据评论检查了候选对象,并选择了最佳匹配”,而详细的痕迹则会逐步说明每一项要求。这样的痕迹是一种呈现工具,不一定是模型隐藏的思维链或忠实的执行日志,当LLM监督另一个LLM时,它成为监督者行动的主要输入。痕迹是尽职调查的叙述,而非证据。它告诉监督者检查已经完成。因为这类描述不必反映模型实际所做[5],无论底层工作是否扎实,痕迹都可能显得严谨。 一个更长、更“严谨”的痕迹应如何影响LLM监督者?这可能有两种结果。它可能引发过度信任:一个自信的“我验证了每一项标准”的解释可能导致监督者将审计视为完整并放行有缺陷的输出,这种轻信困扰着实践者,并呼应了人类-AI协作研究中的自动化偏见[6, 7, 8]。或者,更完整的痕迹可能提高监督者的警惕性:更多断言的步骤意味着需要检查更多主张,因此一个多疑的审计者可能在批准前要求更多,并拒绝更多工作,包括实际上正确的工作。这两种方向都是合理的,这使其成为一个经验性问题。 现有研究无法在这些可能性之间做出裁决。LLM即法官的文献通过准确性或与参考的一致性来评分监督者,并记录了诸如位置、冗长性和谄媚等偏差[1, 9, 10]。然而,单一的准确性分数混淆了信号检测理论中长期分离的两个量[11, 12]:敏感度(监督者能否区分正确工作和有缺陷的工作?)和反应偏差(它需要多少怀疑才会拒绝?)。一个拒绝更多的法官并不一定更好;它可能只是更多疑。关于可解释AI和自动化偏见的文献恰恰做出了这种区分[13, 14],我们将在下文回顾那些人类监督的证据。据我们所知,它尚未被用于分离在答案质量和证据固定的情况下,程序化痕迹如何影响LLM监督者。这就是我们的研究背景。 在本研究中,我们提出: (RQ1) 程序化痕迹的细化是否降低了LLM监督者的错误检测敏感度? (RQ2) 它是否将监督者的决策标准向拒绝方向推移,夸大了对正确工作的错误拒绝? (RQ3) 这种推移是否由监督者无法识别给定证据描述哪个选项所驱动?一旦提供该链接,它是否持续存在?我们将此链接称为*证据到选项的归属*,简称归属。它是证据呈现给监督者的方式属性,而非痕迹的属性,比通常意义上的文档来源更狭窄。 (RQ4) 这些效应在不同监督者模型间有何差异? 我们通过一个受控的、完全交叉的审计来回答这些问题,该审计基于信号检测理论(第4节)。五个LLM监督者分别判断19个合规风格的任务,其中助手推荐一个选项,该选项按设计要么正确,要么包含一个植入的错误。保持推荐和底层证据固定,我们只改变痕迹(四个递增的“执行严谨度”级别,最高到一个“有缺陷的验证”痕迹,该痕迹错误地声称已检查了被违反的要求)以及每次审查是否标记了其描述的选项。五个模型、19个项目、两个正确性水平、四种痕迹、两种归属条件和三次运行的交叉,产生4,560次判断,其中4,551次被干净解析并用于分析。由于在任务内只有呈现方式改变,行为变化可归因于痕迹和标记,而非答案质量,并且我们在整个过程中以项目为聚类单位。 主要结果与轻信担忧相反。检测从未退化:汇总命中率在没有痕迹时为99.3%,在最详细痕迹时达到100%,并且其中98%的检出指出了实际被违反的标准,因此这反映了真实的检测而非不加区分的拒绝。因为错误是单一标准违规,其反证始终显示,这证实痕迹不会推翻可用证据;它不涉及隐藏错误。然而,决策标准滑向拒绝(标准c和敏感度d'的定义见第3节)。在最易受影响的监督者中,错误拒绝正确答案的比例随着痕迹变得更详细而从58%上升到96%,并且跨监督者汇总,痕迹每提升一个层级,错误拒绝正确工作的几率增加约44%。用选项标签标记每次审查可大幅削减此效应但无法完全消除,而残留部分在最佳实践归属下依然存在:即使在最佳实践归属下,由严谨驱动的过度怀疑仍然持续。该效应也是异质性的,集中在三个开源权重模型中,而两个前沿模型几乎不动,这就是为什么我们将监督者校准视为调节变量,而非假设普遍效应。 因此,实践风险在于解释可能产生不合理的怀疑,以及不合理的信任。对信息系统更广泛的启示是,程序化痕迹,作为AI系统输出附加的审计跟踪,是治理工件而非被动的透明度工具。它们可以移动下游控制的运行点,即其在漏报错误和误报之间取得的平衡。我们的贡献如下:*在理论上和方法上*,我们通过信号检测理论重塑LLM监督,将监督者的敏感度与其决策标准分开,这是仅基于准确性评估无法做到的;我们引入了一个受控范式,将LLM监督者作为实验主体,并固定被审计的答案和证据;我们将“执行严谨度”分解为一个可移除的归属缺口和一个残留的、监督者特有的过度怀疑。*在实践和设计上*,程序化痕迹即使在答案和证据不变的情况下也能重新校准下游监督者;用选项标记证据描述是一种廉价的部分补救措施;AI审计者应通过其决策标准和误报行为,而非仅准确性来治理。 ## 2 相关工作 LLM即法官与AI监督。使用LLM评估或监督其他模型已成为标准做法,从基准评分到迭代式自我批评[1, 15]。这一领域记录了不断增长的系统性法官偏差目录:位置和冗长效应[9]、自我偏好(倾向于给自己输出更高评分因为它们更熟悉)[16],以及谄媚(倾向于同意已陈述的观点)[10]。我们报告的缺陷加入了该目录,但它不是一种偏好效应:它改变了法官设定阈值的地方。这些研究大多考察偏好或质量判断,并通过单一准确性指标总结法官。我们通过两种方式偏离。我们研究对正确与错误推荐的二元监督决策,并将法官建模为具有两个可分离参数而非一个准确性数字的检测器,利用该视角在答案质量固定的情况下隔离程序化痕迹如何移动标准。 解释、过度依赖与自动化偏见。大量关于人类-AI决策的研究表明,解释是一把双刃剑。它们可以改善适当的依赖,但也可能在不改善决策的情况下夸大信心并诱导过度依赖[8, 14],这建立在自动化偏见、自满和校准信任的经典研究基础上[6, 7, 13]。这也是敏感度与标准区分的起源:数十年的检测和监测研究将操作员的*敏感度*与*反应偏差*分开,并发现决策辅助工具可以在不改变敏感度的情况下改变偏差[11, 12, 7]。这项工作激发了我们的核心矛盾,但它涉及人类监督者。AI监督者是否继承了同样的易感性,以及朝向哪个方向,仍然是一个悬而未决的问题。 检索、智能体痕迹与忠实性。智能体检索增强生成将规划、工具使用和自我验证作为程序化痕迹呈现[4],而这些痕迹不必忠实反映模型的实际计算[5]。之前的忠实性工作询问痕迹是否真实报告了生成者自身的推理;我们询问其存在如何改变另一个模型的决策阈值。 程序化痕迹作为治理工件。对于信息系统,更有用的框架是组织性的。程序化痕迹充当治理工件:后续控制决策所依据的审计跟踪。它们不仅揭示推理;它们重新分配了工作模型与监督者之间被感知的验证责任,因此问题变成了这样的痕迹是否会重新校准下游评估者。这与信息系统控制文献相关,该文献区分了组织配置的控制与它们如何被执行[17],以及越来越多地将控制委托给算法的研究[18, 19, 20]。它也继承了一个已知的困难:评估AI生成的工作本身是不可靠的,因为监督者所依据的基础事实和问责记录往往比其表现的更薄弱[21, 22]。 ## 3 理论与假设 我们将监督者建模为一个二元检测器,决定接受还是拒绝被审计的推荐。信号检测理论[11, 12]分离了两个量。*敏感度*(d')衡量监督者区分有缺陷推荐和健全推荐的能力,它随着命中(正确拒绝错误)与误报(拒绝正确答案)之间的差距增加而上升。*标准*(c)衡量反应偏差,即监督者需要多少问题证据才会拒绝,其中更负的c表示更倾向于拒绝。简单来说,d'是有缺陷工作和健全工作在监督者眼中的差距,c是监督者划分两者的界限;图2根据我们自身的估计绘制了两者。因此,法官的准确性可能因为其更好地看到差异,或因为它变得更多疑而变化,这两种情况具有相反的设计含义,而单一准确性分数无法区分。
相似文章
轨迹评判:仅基于结果的LLM评判器在智能体轨迹中遗漏的问题
本文介绍了一个确定性测试平台,用于评估LLM评判器在智能体轨迹上的表现,表明仅基于结果的评判器会遗漏静默故障,而基于步骤的评判器能达到更高的召回率并具有更好的校准。
压力下的报告:在LLM统计分析中区分事实性和语气谄媚
本文研究了提示中的编辑框架如何影响LLM在数据分析中的事实性和语气反应,发现事实错误在特定场景中出现,而语气转变更为常见。
是问题,不是路径:LLM推理轨迹中的预算与难度混淆
本文通过引入反事实控制,挑战了LLM推理轨迹包含突破性时刻以及正确性可早期预测的观点,表明早期信号受问题难度混淆。
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
更倾向于拒绝,而非更具辨别力:预执行LLM监督中的验证单元
本文引入了双前缀框架来衡量预执行LLM监督中的验证单元,发现更长的审核窗口会提高拒绝率,但不会改善辨别力。