基于参考的LLM隐藏状态相对表示偏差检测

Hugging Face Daily Papers 论文

摘要

本文提出了一种基于参考的隐藏状态审计方法,以最小计算量检测LLM中的偏差偏移,显示与基准测试中输出级偏差变化的高相关性。

现有的偏差审计方法通常依赖于模型输出,需要昂贵的基准测试或评判模型,并且可能错过那些从未出现在生成文本中的内部偏移。我们提出一种基于参考的方法,审计相关模型变体(例如微调前后)的隐藏状态表示中的偏差。由于微调重塑了表示几何,绝对隐藏状态不可直接比较,因此我们通过每个句子与一组固定锚定句子的相似度来编码每个句子,在共享比较空间中产生相对表示。在那里,我们衡量目标群体在与积极和消极属性关联上的偏移,这个量我们称为表示偏差偏移ΔB。在三个模型家族以及WildGuardMix、DecodingTrust和ToxiGen基准测试中,ΔB与输出级偏差变化在18个测试设置中的15个中相关,在全微调下达到|r| = 0.84 (p < 0.001),在参数高效适配下变得更依赖于模型。通过阈值化ΔB,检测偏差增加的检查点,ROC AUC在0.65到0.99之间,在WildGuardMix和DecodingTrust上,对于所有三个家族,它比基于SEAT的基线分离得更好。ΔB在锚定集合、属性集合和目标模板的变化下也是稳定的。我们的方法不需要特定任务的评估数据,审计一个模型大约需要三分钟,使用比本文考虑的输出级基准测试少3到50倍的计算资源。我们将其视为基于输出审计的补充,而非替代。
查看原文
查看缓存全文

缓存时间: 2026/09/10 10:10

论文页面 - 通过隐藏状态的相对表征实现大语言模型中的基于参考的偏差检测

来源:https://huggingface.co/papers/2609.10060

摘要

本研究提出了一种基于参考的隐藏状态审计方法,该方法通过测量模型变体间表征偏差的偏移,以最小的计算开销检测内部偏差变化。

现有的偏差审计方法通常依赖于模型输出,需要昂贵的基准测试或评判模型,并且可能遗漏从未出现在生成文本中的内部偏移。我们提出一种基于参考的方法,用于审计相关模型变体(例如微调前后)在隐藏状态表征中的偏差(https://huggingface.co/papers?q=hidden-state%20representations)。由于微调(https://huggingface.co/papers?q=fine-tuning)会重塑表征几何结构,绝对隐藏状态无法直接比较,因此我们通过计算每个句子与一组固定锚定句(https://huggingface.co/papers?q=anchor%20sentences)的相似度来对其进行编码,在共享的比较空间中生成相对表征(https://huggingface.co/papers?q=relative%20representations)。在此空间中,我们衡量目标群体与正面和负面属性关联的变化程度,我们将此量称为表征偏差偏移(https://huggingface.co/papers?q=Representational%20Bias%20Shift)ΔB。在三个模型家族以及 WildGuardMix、DecodingTrust 和 ToxiGen 基准测试中,ΔB 与输出层偏差变化在 18 个测试设置中的 15 个里相关,在完全微调(https://huggingface.co/papers?q=fine-tuning)下达到 |r| = 0.84(p < 0.001),在参数高效适配(https://huggingface.co/papers?q=parameter-efficient%20adaptation)下则更具模型依赖性。通过设定 ΔB 阈值,可以检测偏差增加的检查点,其 ROC AUC(https://huggingface.co/papers?q=ROC%20AUC)介于 0.65 到 0.99 之间。在 WildGuardMix 和 DecodingTrust 基准上,对于所有三个模型家族,该方法的区分效果均优于基于 SEAT 的基线(https://huggingface.co/papers?q=SEAT-based%20baseline)。ΔB 在锚定句集、属性集和目标模板变化时也保持稳定。我们的方法无需特定任务的评估数据,审计一个模型仅需约三分钟,计算开销比本文中考虑的输出层基准测试少 3-50 倍。我们将其视为基于输出审计的补充,而非替代。

查看 arXiv 页面(https://arxiv.org/abs/2609.10060)查看 PDF(https://arxiv.org/pdf/2609.10060)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.10060)

在你的智能体中获取此论文:

hf papers read 2609\.10060

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文。

在模型的 README.md 中引用 arxiv.org/abs/2609.10060 以从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文。

在数据集的 README.md 中引用 arxiv.org/abs/2609.10060 以从此页面链接。

引用此论文的 Spaces 0

没有 Space 链接此论文。

在 Space 的 README.md 中引用 arxiv.org/abs/2609.10060 以从此页面链接。

包含此论文的合集 0

没有合集包含此论文。

将此论文添加到合集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

基于参考的LLM蒸馏检测

arXiv cs.LG

本文介绍了一种基于参考的方法,通过成员推断来检测LLM是否是从特定教师模型蒸馏而来。该方法在受控设置下实现了近乎完美的准确性,并提供了关于QwQ、DeepSeek-R1和GPT-OSS之间潜在蒸馏关系的新证据。

超越表面统计:通过内部表示实现LLM鲁棒共形预测

arXiv cs.CL

本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。