解码推理型LLM中隐藏的欺骗:用于欺骗审计的激活解释器
摘要
提出了STATEWITNESS,一种用于审计推理型LLM中欺骗的激活解释器,相比现有监测器取得了显著改进,并提供了可供人工检查的证据。
arXiv:2606.17478v1 公告类型:新
摘要:随着LLM获得更强的推理能力,欺骗行为成为一个日益严重的安全问题。现有的欺骗监测器要么对可见的对话记录进行评分,要么从表示向量中推导出标量探针分数,但几乎没有留下关于为何某个响应可疑的可检查证据。我们提出了STATEWITNESS,一种用于欺骗审计的激活解释器。一个独立的解码器读取目标模型的隐藏状态,然后回答自然语言查询或生成关于这些状态的结构化报告。我们在两个目标推理LLM上,跨越七个欺骗数据集,对STATEWITNESS进行了评估。STATEWITNESS的平均AUROC达到了0.916,相比同一评估协议下最佳黑盒文本监测器相对提升了11.6%,相比最佳激活探针基线相对提升了25.0%。当与现有监测器结合使用时,STATEWITNESS在简单阈值集成中减少了漏检的欺骗实例。除了标量检测外,解码器还返回查询级答案、模式报告以及令牌级或句子级的证据痕迹,供人工检查。我们认为这个界面是构建更广泛的可解释性和对齐工具的潜在基础模块。
查看缓存全文
缓存时间: 2026/06/17 05:40
# 解码推理大语言模型中的隐藏欺骗:面向欺骗审计的激活解释器 来源:https://arxiv.org/abs/2606.17478 查看PDF(https://arxiv.org/pdf/2606.17478) > 摘要:随着大语言模型获得更强的推理能力,欺骗行为成为日益严峻的安全隐患。现有的欺骗监控器要么对可见文本进行评分,要么从表征向量中推导出标量探针分数,无法提供关于某条回复为何可疑的可检验证据。我们提出 STATEWITNESS,一种用于欺骗审计的激活解释器。该解释器通过独立的解码器读取目标模型的隐藏状态,然后回答自然语言查询或生成关于这些状态的结构化报告。我们在两个目标推理大语言模型上,基于七个欺骗数据集对 STATEWITNESS 进行了评估。在相同评估协议下,STATEWITNESS 的平均 AUROC 达到 0.916,相比最佳黑盒文本监控器相对提升 11.6%,相比最佳激活探针基线相对提升 25.0%。当与现有监控器结合使用时,STATEWITNESS 在简单阈值集成中减少了漏检的欺骗样例。除了标量检测外,该解码器还能返回查询级别的答案、模式报告以及词元级或句子级的证据轨迹,供人工检查。我们认为这一界面可作为更广泛的可解释性与对齐工具的潜在构建模块。 ## 提交历史 来自:陈可欣 \[查看电子邮件(https://arxiv.org/show-email/35dc1541/2606.17478)\] **\[v1\]** 2026年6月16日 星期二 03:41:29 UTC(5,902 KB)
相似文章
隐藏思维并非秘密:LLM中的推理痕迹暴露
本文介绍了推理暴露提示(REP)方法,该方法利用代码格式的阴影模型演示,从大语言模型中引出隐藏的推理痕迹,表明接口级别的痕迹隐藏不足以阻止提取有用的推理信号。
DECOR:基于信息操纵理论审计LLM欺骗行为
介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。
点间解读:解码填充标记中的隐藏计算
本文表明,前沿LLM能够在无内容的填充标记上进行多步推理,并且残差流中的隐藏状态可以被解码以高精度恢复中间值,挑战了思维链监控是唯一审计工具这一假设。
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。
智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗
本文介绍了ParliamentBench,一个基于社交推理游戏《秘密希特勒》的开源基准,用于评估LLM在信息不对称条件下的欺骗、说服和推理能力。对约1600场比赛中16个LLM的实验显示,前沿模型形成了一个强大的顶尖集群,而大多数模型难以维持一致的欺骗性人格。