先前审计-修复上下文使LLM验证器阈值趋向宽大

Hugging Face Daily Papers 论文

摘要

本文发现,上下文中的先前审计和修复事件通过转移决策阈值来减少LLM验证器的误报,其中修复内容和审计结果对不同的模型家族产生互补影响。

自动化检查管道越来越多地将一个语言模型作为检查器,另一个(或同一个)作为修复器。我们询问这种连接是否会改变检查器报告的内容。通过测量人类验证正确的ProcessBench跟踪中的误报,保持当前任务字节相同,我们发现模型上下文中已有的完整审计->修复事件在15个模型×措辞组合中降低了误报,相对于长度匹配的非审计控制组,降低了2.8到11.5个百分点,相对于该控制组减少了9%到25%。这一方向与累积消息文献所预测的相反:审计报告错误的事件进一步降低了误报,在模型上所有五种措辞中,该操作干净落地,尽管负性不对称性预测会有更多标记。分解该事件发现修复内容和审计结果是互补的:不同的组件在不同模型家族上产生效果。信号检测分析将变化定位在阈值而非判别力上——标准在15个组合中的15个中移动,并在13个中通过校正存活,而d'在任何情况下都不存活,尽管d'测试在设计上敏感性只有一半——并且对50个误报的人工审核发现82%是完全错误的,因此在这个操作点,这种转移不一定是有害的。启用推理后,该效应在测试的两个模型上保持其相对大小,并且阈值读数也成立。
查看原文
查看缓存全文

缓存时间: 2026/08/18 07:52

论文页面 - 先验审计-修复上下文使LLM验证器阈值趋向宽松

来源:https://huggingface.co/papers/2608.16003

摘要

上下文中的先验审计和修复场景通过改变决策阈值而非区分度来减少误报,其中修复内容和审计结论对不同模型家族具有互补影响。

自动化检查流程越来越多地使用一个语言模型作为检查器,另一个(或同一个)模型作为修复器。我们探究这种配置是否会改变检查器的报告结果。通过在人类验证正确的ProcessBench跟踪上测量误报(https://huggingface.co/papers?q=false%20alarms),并保持当前任务字节级一致,我们发现模型上下文中已完成的审计(https://huggingface.co/papers?q=audit)->修复(https://huggingface.co/papers?q=repair)场景在15种模型×措辞组合中均降低了误报(https://huggingface.co/papers?q=false%20alarms),相比长度匹配的非审计(https://huggingface.co/papers?q=audit)对照组降低了2.8至11.5个百分点,相对减少9%至25%。这一方向与累积消息文献的预测相矛盾:即使在该操纵效果完全呈现的模型上,报告错误的审计(https://huggingface.co/papers?q=audit)场景在所有五种措辞下会进一步降低误报(https://huggingface.co/papers?q=false%20alarms),尽管负面不对称性预测应增加标记数量。场景分解发现修复(https://huggingface.co/papers?q=repair)内容和审计(https://huggingface.co/papers?q=audit)结论具有互补性:不同组件对不同模型家族产生影响。信号检测分析(https://huggingface.co/papers?q=Signal-detection%20analysis)显示变化发生在阈值(https://huggingface.co/papers?q=threshold)而非区分度(https://huggingface.co/papers?q=discrimination)——在15种组合中有15种标准值发生移动且在13种中通过校正,而d’(https://huggingface.co/papers?q=d%27)无一通过,尽管d’检验本身灵敏度只有前者一半——且对50个误报(https://huggingface.co/papers?q=false%20alarms)的人工审计发现82%确实错误,因此在此运行点上该偏移未必有害。启用推理(https://huggingface.co/papers?q=reasoning)后,该效应在测试的两种模型上保持相对大小,阈值(https://huggingface.co/papers?q=threshold)读数在此同样成立。

查看arXiv页面 (https://arxiv.org/abs/2608.16003) 查看PDF (https://arxiv.org/pdf/2608.16003) GitHub0 (https://github.com/parsa-mz/crtitxer) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16003)

通过代理获取本文: hf papers read 2608\.16003 没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无关联本文的模型 在模型README.md中引用arxiv.org/abs/2608.16003以从本页链接。

引用本文的数据集 0

无关联本文的数据集 在数据集README.md中引用arxiv.org/abs/2608.16003以从本页链接。

引用本文的空间 0

无关联本文的空间 在空间README.md中引用arxiv.org/abs/2608.16003以从本页链接。

包含本文的合集 0

无包含本文的合集 将本文添加到合集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

DART:通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移

arXiv cs.CL

# 通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移 来源:[https://arxiv.org/html/2604.16845](https://arxiv.org/html/2604.16845) Ziwen Pan1 Zihan Liang111footnotemark:1 Jad Kabbara2 Ali Emami1 1埃默里大学 2麻省理工学院 {ziwen\.pan, zihan\.liang, ali\.emami}@emory\.edu, jkabbara@mit\.edu ###### 摘要 经过安全调优的大语言模型(LLM)通常会回避承认人口统计差异,即使这种承认在事实上是正确的(例如,基于血统的