基于参考的LLM隐藏状态相对表示偏差检测
摘要
本文提出了一种基于参考的隐藏状态审计方法,以最小计算量检测LLM中的偏差偏移,显示与基准测试中输出级偏差变化的高相关性。
查看缓存全文
缓存时间: 2026/09/10 10:10
论文页面 - 通过隐藏状态的相对表征实现大语言模型中的基于参考的偏差检测
来源:https://huggingface.co/papers/2609.10060
摘要
本研究提出了一种基于参考的隐藏状态审计方法,该方法通过测量模型变体间表征偏差的偏移,以最小的计算开销检测内部偏差变化。
现有的偏差审计方法通常依赖于模型输出,需要昂贵的基准测试或评判模型,并且可能遗漏从未出现在生成文本中的内部偏移。我们提出一种基于参考的方法,用于审计相关模型变体(例如微调前后)在隐藏状态表征中的偏差(https://huggingface.co/papers?q=hidden-state%20representations)。由于微调(https://huggingface.co/papers?q=fine-tuning)会重塑表征几何结构,绝对隐藏状态无法直接比较,因此我们通过计算每个句子与一组固定锚定句(https://huggingface.co/papers?q=anchor%20sentences)的相似度来对其进行编码,在共享的比较空间中生成相对表征(https://huggingface.co/papers?q=relative%20representations)。在此空间中,我们衡量目标群体与正面和负面属性关联的变化程度,我们将此量称为表征偏差偏移(https://huggingface.co/papers?q=Representational%20Bias%20Shift)ΔB。在三个模型家族以及 WildGuardMix、DecodingTrust 和 ToxiGen 基准测试中,ΔB 与输出层偏差变化在 18 个测试设置中的 15 个里相关,在完全微调(https://huggingface.co/papers?q=fine-tuning)下达到 |r| = 0.84(p < 0.001),在参数高效适配(https://huggingface.co/papers?q=parameter-efficient%20adaptation)下则更具模型依赖性。通过设定 ΔB 阈值,可以检测偏差增加的检查点,其 ROC AUC(https://huggingface.co/papers?q=ROC%20AUC)介于 0.65 到 0.99 之间。在 WildGuardMix 和 DecodingTrust 基准上,对于所有三个模型家族,该方法的区分效果均优于基于 SEAT 的基线(https://huggingface.co/papers?q=SEAT-based%20baseline)。ΔB 在锚定句集、属性集和目标模板变化时也保持稳定。我们的方法无需特定任务的评估数据,审计一个模型仅需约三分钟,计算开销比本文中考虑的输出层基准测试少 3-50 倍。我们将其视为基于输出审计的补充,而非替代。
查看 arXiv 页面(https://arxiv.org/abs/2609.10060)查看 PDF(https://arxiv.org/pdf/2609.10060)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.10060)
在你的智能体中获取此论文:
hf papers read 2609\.10060
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文。
在模型的 README.md 中引用 arxiv.org/abs/2609.10060 以从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.10060 以从此页面链接。
引用此论文的 Spaces 0
没有 Space 链接此论文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.10060 以从此页面链接。
包含此论文的合集 0
没有合集包含此论文。
将此论文添加到合集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
基于参考的大型语言模型偏差检测:通过隐藏状态的相对表示
本文提出了一种基于参考的方法,通过分析模型变体间隐藏状态的相对表示来检测大型语言模型中的偏差,引入了表示偏差偏移(ΔB),该偏移与输出层面的偏差变化高效相关。
公平输出,偏见内部:大语言模型在高风险决策中潜在偏见的因果效力与非对称性
本文研究了指令微调的大语言模型如何在高风险决策(如抵押贷款承销)中表现出公平输出,同时保留有偏见的内部表征,表明这些隐藏偏见具有因果效力、非对称性,且可通过激活引导加以利用。
基于参考的LLM蒸馏检测
本文介绍了一种基于参考的方法,通过成员推断来检测LLM是否是从特定教师模型蒸馏而来。该方法在受控设置下实现了近乎完美的准确性,并提供了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。
超越表面统计:通过内部表示实现LLM鲁棒共形预测
本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。