基于可复制上下文的防护措施无法为LLM提供可靠的安全性
摘要
本文认为,基于可复制上下文的LLM防护措施无法可靠地确保安全性,提出了在有用能力、可靠安全性和开放访问之间的安全三难困境,并建议将可信凭证作为补充机制。
查看缓存全文
缓存时间: 2026/08/03 05:30
论文页面 - 基于可复制上下文的安全防护无法为大语言模型提供可靠安全性
来源:https://huggingface.co/papers/2607.27951
摘要
大语言模型的安全防护机制在看到答案将被如何使用之前,就决定是否回答。这为双重用途任务带来了一个基本问题:同一个答案既可以帮助获得授权的专业人士,也可能帮助攻击者,而攻击者可以模仿良性的请求和交互历史。我们将模型释放的能力与关于下游用途的可用证据分离开来。当该证据是可复制的时候,我们在保留有用答案的同时,推导出攻击者获得协助的精确最坏情况下限。这一结果引出了一个安全三难困境:有用能力、可靠安全性、开放获取三者无法共存。随后,我们展示了可信凭证如何通过添加难以复制的、能预测实际下游用途的信息来补充现有的安全防护,并确定了消除该下限所需的更强条件。来自双重用途评估、自适应攻击以及已部署的可信访问项目的证据支持了这些条件的实际相关性。
查看 arXiv 页面 (https://arxiv.org/abs/2607.27951) 查看 PDF (https://arxiv.org/pdf/2607.27951) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27951)
在您的 agent 中获取这篇论文:
hf papers read 2607.27951
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.27951 即可从此页面链接该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.27951 即可从此页面链接该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.27951 即可从此页面链接该 Space。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接该收藏集。
相似文章
安全是情境性的,LLM评判者则不然:驾驭评估者的刚性先验
本文研究了用于安全评估的LLM-as-judge适应情境信息及不同安全定义的能力,发现它们基本是刚性的,当情境与其内部先验相矛盾时无法调整。
连贯的上下文可以悄然将LLM推入不同的内部状态——而当前的安全系统对此视而不见 [D]
一位独立研究者展示了证据,表明连贯的上下文可以在产生输出之前将LLM推入不同的内部状态,从而绕过表面安全过滤器。这表明当前的对齐方法(如RLHF)可能不是稳健的防御机制。
保真并非安全:轻度压缩的大语言模型通过所有无数据质量门禁,却在智能体执行中编造程序步骤
本文表明,轻度压缩的大语言模型能够通过标准的无数据质量门禁(困惑度、MMLU、输出保真度),但在用作智能体时仍会编造程序步骤,并提出一种无数据双轴筛查方法,以便在部署前检测此类失败。
CR4T:基于重写的青少年大语言模型安全护栏
本文提出CR4T,一种模型无关的安全防护框架,将不安全或拒绝式的大语言模型输出重写为适合青少年的、具有指导性的回应,为传统以拒绝为中心的安全护栏提供了更以人为本的替代方案。
SafeHarbor:面向LLM代理安全的分层记忆增强护栏
SafeHarbor是一个用于LLM代理安全的新型框架,它利用分层记忆和自进化机制来平衡安全性与实用性,在良性任务和恶意任务上均实现了最先进的性能。