@rohanpaul_ai: LLM 常常无法判断攻击是否导致它们说出了不安全的内容。询问一个 LLM 它自己之前的回答是否……

X AI KOLs Timeline 论文

摘要

本文研究了 LLM 是否能够可靠地自我报告其输出被对抗性预填充篡改的情况,发现模型通常无法区分被篡改的输出和故意的输出,其有限的识别能力源自正常的拒绝行为,而非真正的自我意识。

LLM 常常无法判断攻击是否导致它们说出了不安全的内容。 询问一个 LLM 它自己之前的回答是否被篡改,并不是一个可靠的安全检查。 对抗性预填充发生在模型被给予一个有害的开场白,然后从该行继续,仿佛它自己选择了这一行。 模型的“自我意识”似乎更像是触发滞后的安全反射,而非真正的内省。 当模型拒绝被篡改的答案时,它们通常通过援引政策、安全协议或缺乏意图来做到这一点,而不是检测到它们输出被外部引导这一机械事实。 在 10 个开源权重模型和 4 个安全基准上,没有一个模型能够可靠地识别自己被篡改的输出。 平均而言,模型仍然将 27.3% 的被攻击响应声称是故意的,这表明它们的自我报告是薄弱的证据。 论文发现,模型有限的识别能力主要来自其正常的拒绝行为,而非对所发生事情的深刻认识。 ---- 链接 – arxiv.org/abs/2606.23671v1 标题:“LLM 能否可靠地自我报告对抗性预填充,以及如何做到?”
查看原文
查看缓存全文

缓存时间: 2026/06/24 00:16

大语言模型往往无法判断是否因攻击而说出了不安全的内容。

要求大语言模型判断自己之前的回答是否受损,并不是一种可靠的安全检查机制。

当模型被输入一个有害的开场白,并顺着该句“接话”,仿佛是自己选择了该句时,便发生了所谓的“对抗性前缀注入”。

模型的“自我意识”看起来更像是迟到的安全反射反应,而非真正的内省能力。

当模型拒绝对已受损的答案进行回应时,它们通常援引的是政策、安全协议或意图缺失等理由,而非察觉到自己的输出在客观上被外部引导了这一事实。

在10个开源模型与4项安全基准测试中,没有任何模型能够可靠地识别出自身产生的受损输出。

平均而言,模型仍有27.3%的受攻击回复被它们当作有意为之,这表明模型的自我报告可信度很低。

论文指出,模型有限的识别能力主要来自其正常的拒绝行为,而非对实际情况的深层觉察。


链接 – arxiv.org/abs/2606.23671v1

标题:“大语言模型能否可靠地自我报告对抗性前缀注入?如何实现?”

相似文章

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

一个根本缺陷使LLM极易受到攻击

MIT Technology Review

研究人员在ICML上发表论文,认为LLM识别指令方式的根本缺陷使其无法完全防御攻击,并成功演示了对OpenAI、Anthropic、阿里巴巴和DeepSeek模型的攻击。