基于可复制上下文的防护措施无法为LLM提供可靠的安全性

Hugging Face Daily Papers 论文

摘要

本文认为,基于可复制上下文的LLM防护措施无法可靠地确保安全性,提出了在有用能力、可靠安全性和开放访问之间的安全三难困境,并建议将可信凭证作为补充机制。

大型语言模型的防护措施在回答被使用之前就决定是否回答。这给双重用途任务带来了一个基本问题:同一个回答既可以帮助获得授权的专业人士,也可以帮助攻击者,而攻击者可以模仿良性的请求和交互历史。我们将模型释放的能力与关于下游用途的可用证据分开。当该证据可复制时,我们推导出在保留有用回答的同时攻击者获得帮助的最坏情况下限。结果产生了安全三难困境:有用能力、可靠安全性和开放访问无法共存。然后我们展示了可信凭证如何通过添加难以复制的、预测实际下游用途的信息来补充现有防护措施,并指出了消除该下限所需的更强条件。来自双重用途评估、自适应攻击和已部署的可信访问计划的证据支持这些条件的实际相关性。
查看原文
查看缓存全文

缓存时间: 2026/08/03 05:30

论文页面 - 基于可复制上下文的安全防护无法为大语言模型提供可靠安全性

来源:https://huggingface.co/papers/2607.27951

摘要

大语言模型的安全防护机制在看到答案将被如何使用之前,就决定是否回答。这为双重用途任务带来了一个基本问题:同一个答案既可以帮助获得授权的专业人士,也可能帮助攻击者,而攻击者可以模仿良性的请求和交互历史。我们将模型释放的能力与关于下游用途的可用证据分离开来。当该证据是可复制的时候,我们在保留有用答案的同时,推导出攻击者获得协助的精确最坏情况下限。这一结果引出了一个安全三难困境:有用能力、可靠安全性、开放获取三者无法共存。随后,我们展示了可信凭证如何通过添加难以复制的、能预测实际下游用途的信息来补充现有的安全防护,并确定了消除该下限所需的更强条件。来自双重用途评估、自适应攻击以及已部署的可信访问项目的证据支持了这些条件的实际相关性。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27951) 查看 PDF (https://arxiv.org/pdf/2607.27951) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27951)

在您的 agent 中获取这篇论文:

hf papers read 2607.27951

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27951 即可从此页面链接该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.27951 即可从此页面链接该数据集。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27951 即可从此页面链接该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接该收藏集。

相似文章

CR4T:基于重写的青少年大语言模型安全护栏

arXiv cs.CL

本文提出CR4T,一种模型无关的安全防护框架,将不安全或拒绝式的大语言模型输出重写为适合青少年的、具有指导性的回应,为传统以拒绝为中心的安全护栏提供了更以人为本的替代方案。