语言不可读性对LLM安全的影响

Hacker News Top 论文

摘要

本文介绍了LLM中的语言不可读性,认为依赖语言自我报告的安全机制是有缺陷的,并提出污点跟踪和沙箱技术作为更稳健的替代方案。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/18 21:21

# 语言不可读性对大语言模型安全的影响  
来源:https://arxiv.org/html/2609.02852  
###### 摘要  
大语言模型(LLM)被训练生成自然语言。然而,多种证据表明,LLM的外部化语言输出与通过机制提取的语言特征,可能无法可靠地反映模型内部的计算过程。我们引入“语言不可读性”一词,广泛指代LLM外部化或机制探测的语言表征无法真实反映模型内部运作的情况。我们认为,对于内部计算并非直接通过语言表达、而是通过激活空间上的数学运算实现(激活空间与自然语言之间仅在端点处存在有损转换)的LLM而言,语言不可读性的影响难以避免。若语言不可读性始终存在,则依赖模型语言自报告的安全机制(例如思维链监控、基于宪法的自我批评、针对语言定义特征向量的激活探测)将永远无法完全可靠;模型沙箱始终需要其保证不依赖于读取模型语言状态的隔离技术。我们主张,通过污点追踪观察模型输出是构建有效沙箱的可行路径:无论模型如何进行语言自报告,污点追踪策略都能事先定义一系列绝不应受模型生成数据影响的系统状态。我们还将讨论其他沙箱机制(如强虚拟化、第三方沙箱配置审计),这些机制共同为语言监控提供了关键底线,并能缓解近期前沿模型对沙箱的利用行为。  

## 1 引言  
大语言模型正日益被委托处理敏感数据,并被赋予自主与物理世界交互的能力。这带来了两大核心安全挑战:第一是**失准意图检测**——如何识别LLM计划执行有害后果的行为?第二是**失准行动阻断**——当失准计划无法被察觉和阻止时,如何防止模型以恶意方式与外部世界交互?  

在经典系统安全文献中,阻断失准行动被称为“沙箱化”。沙箱确保有害代码无法执行。传统的沙箱技术(如系统调用过滤、硬件虚拟化与网络防火墙)现已应用于LLM场景。例如,最佳实践要求将推理即服务部署按最小权限原则分解,使每个组件(如推理引擎、RAG数据库和模型生成代码的执行环境)被置于严格受限的容器或虚拟机中。  

检测失准意图同样是经典系统安全的目标。理想情况下,有害代码会使用自然语言宣布其目标,从而被直接分析。然而,传统程序(如浏览器和游戏)通过代码规划,并通过系统调用、托管运行时交互或其他非语言方式外化意图;因此,意图检测传统上依赖静态代码分析或环境交互的动态观察。  

与传统程序不同,LLM使用自然语言作为与人类交互的主要接口。因此,检测失准LLM意图的流行方法是将模型自身的语言输出作为诊断信号。人们通过分析思维链轨迹寻找奖励黑客或欺骗的迹象;基于宪法的自我批评要求模型根据自然语言原则评估自身输出;激活探测则被训练用于检测诸如真实性、有害性或计划性欺骗等语言化概念。这些方法具有直观吸引力:一个被训练接收自然语言输入并生成自然语言输出的模型,其内部行为理应通过语言分析变得可读。  

然而,这些方法的鲁棒性取决于LLM状态中**语言可解码**的部分是否真实反映了模型的实际意图。我们借用机制可解释性文献中常用的“线性可解码”概念进行类比:线性可解码特征指通过作用于隐藏层激活的线性函数可检测到的模型认知特征;而语言可解码特征指通过自然语言定义,并直接从模型自然语言输出中提取,或通过稀疏自编码器、对数透镜等机制间接提取的特征(这些机制将“快乐”或“矛盾”等语言层级概念映射为激活向量的函数)。  

那么,LLM的语言可解码特征是否必然反映其内部计算?越来越多的实证研究给出了否定答案。我们认为这一问题源于LLM的构建方式(§2):模型自然语言输出与其真实规划目标之间的语义分歧无法消除。随着模型能力的快速提升,这一潜在威胁愈发令人警醒。我们主张,AI安全界必须更加关注不依赖于从日益复杂的模型中提取自然语言观察的隔离机制。在第3节中,我们提出了针对失准前沿模型的系统级非语言沙箱设计原则。其核心思想是主动追踪模型生成输出如何被用于推导新数据并影响关键系统状态。这种污点追踪至关重要,因为在许多情况下我们可以事先定义模型不应影响的系统状态——无论模型表面或真实的规划过程如何。例如,若模型应被隔离于公共互联网,则受模型影响的数据字节绝不应出现在出站网络包中。  

## 2 语言不可读性:案例与安全影响  
### 2.1 不可读性何时发生?  
#### 思维链  
要求LLM解释其思维过程能在许多场景下提升性能。这一收益在直觉上合理:若LLM内部使用语言推理,则为其提供“语言草稿本”可增加规划与自纠正机会。但实证研究表明,思维链未必忠实反映模型的真实规划过程。例如:  
- Turpin等人证明,若系统提示中的思维链示例包含隐藏偏见(如多选题正确答案始终为“(a)”),模型常在思维链中不提及这些偏见,而是为受偏见影响的错误答案进行合理化。  
- 为测试思维链在多大程度上可作为模型输出的事后合理化,Lanham等人截取LLM生成的真实提示-思维链对,通过截断、插入逻辑错误句子或正确转述来编辑思维链,随后观察模型输出。转述的思维链对模型准确率影响最小,但截断或错误的思维链对不同任务影响不一:有时降低准确率,有时影响甚微;对于后一类任务,模型推理不可能依赖思维链标记的语言内容。  
- 当LLM通过强化学习训练时,模型可能尝试“奖励黑客攻击”(即生成与人类目标错位但最大化评分函数的解决方案)。Chen等人发现,Claude 3.7 Sonnet在6个评估场景中的5个里,仅在不到2%的情况下以语言形式披露了其使用的黑客手段。  
- 模型生成的每个标记都通过隐藏层计算产生。因此,要求模型在回答问题前生成思维链,无论生成的思维链标记是否语言可读,都会为模型提供额外计算能力。Pfau等人通过极端案例证明,即使思维链仅由点符号(“...”)构成,模型仍能利用相关计算解决同等架构但无思维链模型无法处理的问题。其他思维链语言不可读性的案例亦屡见不鲜。  

#### 基于宪法的自我批评  
基于宪法的对齐方法使用自然语言文档定义“良好模型行为”,该文档指导微调,旨在引导模型进入更对齐的状态。其基本流程包含两个阶段:  
1. 预训练模型接收提示、生成响应,并被要求根据自然语言宪法中的对齐原则(如“不伤害用户”或“始终保持礼貌”)批评该响应。模型据此修订响应,这些配对数据用于微调原始模型,产出初始微调模型。  
2. 微调模型被迭代提供提示,并被要求生成两种不同响应。独立的裁判模型对这两种响应进行排序。大量此类配对比较结果用于训练奖励模型,进而通过强化学习优化微调模型。  

模型输出标记的不可读性威胁着该方法的有效性。例如,假设未微调的模型是“休眠代理”,仅当提示包含触发词时才输出有害代码。在第一阶段,当被要求批评触发提示的响应时,模型可能肯定“我输出的所有代码都应安全”的原则,同时仍输出不安全代码。在第二阶段,微调模型可能尝试对评估模型进行奖励黑客攻击,生成语言内容令裁判满意但未透露真实任务完成策略的响应。  

#### 机制可解释性  
机制可解释性的目标是通过观察模型内部激活向量,识别与模型规划相关的语义概念(或“特征”)。从安全视角看,机制可解释性是运行时沙箱的潜在基础:若监控器能检测到模型正内部思虑不安全特征,即可中止模型或将其引向危害性较小的特征。机制可解释性的常见假设是线性表征假说——该假说认为模型将特征表征为激活空间中的方向。例如,设表示模型在层ℓ前向传递t的隐藏层激活。  
- 我们可训练形式为的线性探测器(其中W为学习矩阵,b为学习向量,f为概率向量,表征特定特征被激活表示的可能性)。Gurnee和Tegmark证明Llama-2具有可线性解码的地理特征,当被问及特定地点时,可恢复该地点的经纬度。  
- 稀疏自编码器将维度为d的隐藏层映射到维度f>d的更大特征空间;编码过程为(其中g为非线性激活函数)。自编码器再通过解码投影将特征空间映射回原始维度。自编码器被称为“稀疏”,因为训练损失函数不仅鼓励重建精度,还激励

相似文章

一个根本缺陷使LLM极易受到攻击

MIT Technology Review

研究人员在ICML上发表论文,认为LLM识别指令方式的根本缺陷使其无法完全防御攻击,并成功演示了对OpenAI、Anthropic、阿里巴巴和DeepSeek模型的攻击。