先前审计-修复上下文使LLM验证器阈值趋向宽大
摘要
本文发现,上下文中的先前审计和修复事件通过转移决策阈值来减少LLM验证器的误报,其中修复内容和审计结果对不同的模型家族产生互补影响。
查看缓存全文
缓存时间: 2026/08/18 07:52
论文页面 - 先验审计-修复上下文使LLM验证器阈值趋向宽松
来源:https://huggingface.co/papers/2608.16003
摘要
上下文中的先验审计和修复场景通过改变决策阈值而非区分度来减少误报,其中修复内容和审计结论对不同模型家族具有互补影响。
自动化检查流程越来越多地使用一个语言模型作为检查器,另一个(或同一个)模型作为修复器。我们探究这种配置是否会改变检查器的报告结果。通过在人类验证正确的ProcessBench跟踪上测量误报(https://huggingface.co/papers?q=false%20alarms),并保持当前任务字节级一致,我们发现模型上下文中已完成的审计(https://huggingface.co/papers?q=audit)->修复(https://huggingface.co/papers?q=repair)场景在15种模型×措辞组合中均降低了误报(https://huggingface.co/papers?q=false%20alarms),相比长度匹配的非审计(https://huggingface.co/papers?q=audit)对照组降低了2.8至11.5个百分点,相对减少9%至25%。这一方向与累积消息文献的预测相矛盾:即使在该操纵效果完全呈现的模型上,报告错误的审计(https://huggingface.co/papers?q=audit)场景在所有五种措辞下会进一步降低误报(https://huggingface.co/papers?q=false%20alarms),尽管负面不对称性预测应增加标记数量。场景分解发现修复(https://huggingface.co/papers?q=repair)内容和审计(https://huggingface.co/papers?q=audit)结论具有互补性:不同组件对不同模型家族产生影响。信号检测分析(https://huggingface.co/papers?q=Signal-detection%20analysis)显示变化发生在阈值(https://huggingface.co/papers?q=threshold)而非区分度(https://huggingface.co/papers?q=discrimination)——在15种组合中有15种标准值发生移动且在13种中通过校正,而d’(https://huggingface.co/papers?q=d%27)无一通过,尽管d’检验本身灵敏度只有前者一半——且对50个误报(https://huggingface.co/papers?q=false%20alarms)的人工审计发现82%确实错误,因此在此运行点上该偏移未必有害。启用推理(https://huggingface.co/papers?q=reasoning)后,该效应在测试的两种模型上保持相对大小,阈值(https://huggingface.co/papers?q=threshold)读数在此同样成立。
查看arXiv页面 (https://arxiv.org/abs/2608.16003) 查看PDF (https://arxiv.org/pdf/2608.16003) GitHub0 (https://github.com/parsa-mz/crtitxer) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16003)
通过代理获取本文:
hf papers read 2608\.16003
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无关联本文的模型 在模型README.md中引用arxiv.org/abs/2608.16003以从本页链接。
引用本文的数据集 0
无关联本文的数据集 在数据集README.md中引用arxiv.org/abs/2608.16003以从本页链接。
引用本文的空间 0
无关联本文的空间 在空间README.md中引用arxiv.org/abs/2608.16003以从本页链接。
包含本文的合集 0
无包含本文的合集 将本文添加到合集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
基于不同微调策略和模型规模的LLM归因分析在自动代码合规性检查中的应用
本文使用基于扰动的归因分析方法,分析了不同微调策略(全量微调、LoRA、量化LoRA)和模型规模对LLM在自动代码合规性任务中解释行为的影响。研究发现全量微调产生的归因模式比参数高效方法更集中,而较大的模型会形成特定的解释策略,但性能收益在超过7B参数后出现递减。
别让我的LLM崩溃:注意力层剪枝对解释忠实性与置信度校准的影响
本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。
LLM代理中的忠实不确定性:实践中校准与效用权衡
一位从业者讨论了LLM代理中的校准与效用权衡,分享了基于验证器的流水线经验,该流水线将幻觉工具调用减少了约60%,但引入了延迟成本并丢失了简单的正确答案。
DART:通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移
# 通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移 来源:[https://arxiv.org/html/2604.16845](https://arxiv.org/html/2604.16845) Ziwen Pan1 Zihan Liang111footnotemark:1 Jad Kabbara2 Ali Emami1 1埃默里大学 2麻省理工学院 {ziwen\.pan, zihan\.liang, ali\.emami}@emory\.edu, jkabbara@mit\.edu ###### 摘要 经过安全调优的大语言模型(LLM)通常会回避承认人口统计差异,即使这种承认在事实上是正确的(例如,基于血统的
安全是情境性的,LLM评判者则不然:驾驭评估者的刚性先验
本文研究了用于安全评估的LLM-as-judge适应情境信息及不同安全定义的能力,发现它们基本是刚性的,当情境与其内部先验相矛盾时无法调整。