@rohanpaul_ai: LLM 常常无法判断攻击是否导致它们说出了不安全的内容。询问一个 LLM 它自己之前的回答是否……
摘要
本文研究了 LLM 是否能够可靠地自我报告其输出被对抗性预填充篡改的情况,发现模型通常无法区分被篡改的输出和故意的输出,其有限的识别能力源自正常的拒绝行为,而非真正的自我意识。
查看缓存全文
缓存时间: 2026/06/24 00:16
大语言模型往往无法判断是否因攻击而说出了不安全的内容。
要求大语言模型判断自己之前的回答是否受损,并不是一种可靠的安全检查机制。
当模型被输入一个有害的开场白,并顺着该句“接话”,仿佛是自己选择了该句时,便发生了所谓的“对抗性前缀注入”。
模型的“自我意识”看起来更像是迟到的安全反射反应,而非真正的内省能力。
当模型拒绝对已受损的答案进行回应时,它们通常援引的是政策、安全协议或意图缺失等理由,而非察觉到自己的输出在客观上被外部引导了这一事实。
在10个开源模型与4项安全基准测试中,没有任何模型能够可靠地识别出自身产生的受损输出。
平均而言,模型仍有27.3%的受攻击回复被它们当作有意为之,这表明模型的自我报告可信度很低。
论文指出,模型有限的识别能力主要来自其正常的拒绝行为,而非对实际情况的深层觉察。
链接 – arxiv.org/abs/2606.23671v1
标题:“大语言模型能否可靠地自我报告对抗性前缀注入?如何实现?”
相似文章
区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。
大语言模型真的能遗忘吗?通过对抗性评估揭示遗忘差距
该研究揭示了大语言模型在机器遗忘方面的显著差距,表明对抗性评估能够揭示遗忘信息的可恢复性,即使在使用强标准指标的情况下,凸显了对抗性压力测试的必要性。
鲁棒批评者:防御LLMs免受多轮攻击
本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。
相同问题,不同答案:超越准确性评估LLM的可靠性
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。
一个根本缺陷使LLM极易受到攻击
研究人员在ICML上发表论文,认为LLM识别指令方式的根本缺陷使其无法完全防御攻击,并成功演示了对OpenAI、Anthropic、阿里巴巴和DeepSeek模型的攻击。