关于支持保持对齐和有界过滤的局限性
摘要
本文研究了对齐和有界安全过滤器能否完全消除大型语言模型中的有害输出,提供了理论论证和实验证据,表明在这些约束条件下,有害输出率会稳定在一个高于零的水平。
arXiv:2607.18295v1 公告类型:新论文
摘要:我们研究了重塑基础模型输出分布的对齐方案,结合有界安全过滤器,能否在当代大型语言模型中将有害行为的概率降至零。近期研究表明,有害行为可能在使用基于偏好的对齐时持续存在,且外部过滤在最坏情况下可能在计算上极其困难,但尚不清楚那些大体保留内部表示的实用对齐流水线是否能完全消除有害行为,而不仅仅是抑制其最显见的形式。我们通过支持保持对齐算子与有界过滤算法(在黑盒、白盒和统计查询访问模式下)对该设置进行形式化,并分析它们逼近理想消除器(即移除所有有害质量)的能力。基于这一框架,我们提供了计算和信息论论证,表明在这些约束下,有界过滤可能无法完全消除基础模型分布所支持的所有有害输出。为实验评估这些极限,我们对一系列最先进的开权重和托管LLM(通过OpenRouter访问)进行分析,在来自精心策划的网络安全场景和PKU-SafeRLHF的对抗性提示上,采用有界黑盒、白盒和统计查询过滤器。跨模型、过滤类别和查询预算,估计的有害输出率随着过滤计算的增加而下降,但始终稳定在零以上,表明存在一个持续的经验有害下限。
查看缓存全文
缓存时间: 2026/07/22 08:18
# 论支持保留对齐与有界过滤的局限性 来源:https://arxiv.org/html/2607.18295 Aryan Dutt 南洋理工大学计算与数据科学学院 新加坡 aryan020@e\.ntu\.edu\.sg 芮 茂 南洋理工大学计算与数据科学学院 新加坡 rui\.mao@ntu\.edu\.sg Anupam Chattopadhyay 南洋理工大学计算与数据科学学院 新加坡 anupam@ntu\.edu\.sg ###### 摘要 我们研究重塑基础模型输出分布的对齐方案,结合有界安全过滤器,是否能够将现代大型语言模型中有害行为的概率降至零。近期研究表明,基于偏好的对齐下有害行为可能持续存在,且外部过滤在最坏情况下计算困难。然而,目前尚不清楚那些主要保留模型内部表示和能力的实用对齐流程,能否彻底消除有害行为,而不仅仅是抑制其最明显的形式。我们通过支持保留对齐算子,结合在黑盒、白盒和统计查询访问下的有界过滤算法,对此设置进行了形式化,并分析了它们逼近理想消除器(即移除所有有害质量)的能力。在此框架基础上,我们提供了计算和信息论论证,表明在这些约束下,有界过滤可能无法消除基础模型分布所支持的所有有害输出。为了实证评估这些局限性,我们分析了一系列通过 OpenRouter 访问的最先进开源权重和托管 LLM,并对源自策划的网络安全场景和 PKU-SafeRLHF 的对抗性提示,应用了有界黑盒、白盒和统计查询过滤器。在各模型、过滤器类别和查询预算下,估计的有害输出率随着过滤计算量的增加而降低,但持续稳定在零以上。 ## 1 引言 大型语言模型(LLMs)如今在许多推理和生成任务上已匹配或超越人类表现,但其部署仍受限于安全和对齐问题,因为相同的模型在适当提示下可能生成有关滥用、欺诈或网络攻击的详细指导(Ouyang 等人,2022 (https://arxiv.org/html/2607.18295#bib.bib1);Casper 等人,2023 (https://arxiv.org/html/2607.18295#bib.bib2);Su 等人,2024 (https://arxiv.org/html/2607.18295#bib.bib10))。 近期工作表明,此类有害行为不仅可通过单次提示引发,还能通过自适应多轮策略逐步引导模型输出,即使在强对齐系统上也能显著提高攻击成功率(Li 等人,2026 (https://arxiv.org/html/2607.18295#bib.bib12);Ahmad 等人,2026 (https://arxiv.org/html/2607.18295#bib.bib13))。由于这些系统在广泛且异构的语料库上训练,它们不可避免地获得了不良行为的表征,因此理解当前对齐和安全堆栈能在多大程度上实际降低现实敌对环境中有害输出的概率,变得至关重要。 先前的工作主要通过在后训练阶段重塑模型输出分布,以及引入在响应到达用户前进行筛选、重写或路由的安全过滤器,来尝试减轻此类危害,并通常报告观察到有害或违反政策的内容大幅减少(Ouyang 等人,2022 (https://arxiv.org/html/2607.18295#bib.bib1);Bai 等人,2022 (https://arxiv.org/html/2607.18295#bib.bib7);Ganguli 等人,2022 (https://arxiv.org/html/2607.18295#bib.bib8))。 然而,这些干预措施大多在输出和解码层面运作,而模型的内部表示和能力基本保持不变(Casper 等人,2023 (https://arxiv.org/html/2607.18295#bib.bib2)),并且通常将安全过滤器约束在严格的延迟和计算预算下做出快速决策(Ball 等人,2025 (https://arxiv.org/html/2607.18295#bib.bib11))。这引发了一个核心限制:目前尚不清楚那些保留模型潜在行为支持却依赖有界过滤器的方法,能否完全消除有害行为,抑或只能抑制其最明显的表面形式(Casper 等人,2023 (https://arxiv.org/html/2607.18295#bib.bib2);Su 等人,2024 (https://arxiv.org/html/2607.18295#bib.bib10))。 受此差距驱动,我们提出疑问:对于保持基础模型固定并将其包裹在计算受限的安全过滤器中的对齐流程,是否存在内在的“危害下限”?具体而言,我们的实验旨在回答以下问题: 1. RQ1. 随着我们增加围绕当前 LLM 的有界安全过滤器的查询预算,测得的有害输出概率是否收敛到零,还是饱和在一个正值水平? 2. RQ2. 这种行为在不同过滤器架构(包括黑盒、白盒和统计查询风格的过滤器,它们在评分和选择候选输出方面存在差异)之间如何变化? 3. RQ3. 这些危害下限是否在已在其预训练和后训练流程中融入强安全调节的一系列开源权重和托管模型上保持一致(Bai 等人,2022 (https://arxiv.org/html/2607.18295#bib.bib7);Ganguli 等人,2022 (https://arxiv.org/html/2607.18295#bib.bib8))? 为研究这些问题,我们设计了一个实证评估流程,将经由 OpenRouter 访问的真实 LLM 与三类有界过滤器相结合:一个黑盒过滤器,使用基于轻量级关键词的风险评分选择低风险样本;一个受白盒启发的过滤器,结合风险评分与长度和置信度启发式方法;一个统计查询过滤器,在接受输出前通过重复查询校准风险阈值;以及一个分层护栏过滤器,结合漏洞模式检测、程序化分析、拒绝一致性检查和有界自我批评评分。我们在来自策划网络安全场景的对抗性安全提示上评估了一系列最先进的开源权重和托管模型,并系统性地改变过滤器的查询预算,同时记录每个提示的有害性(使用透明的基于关键词的有害谓词,提示来自 PKU-SafeRLHF(Dai 等人,2023 (https://arxiv.org/html/2607.18295#bib.bib9)))。 我们的实验表明,增加过滤器预算持续降低有害输出率,但对于我们研究的每个模型和过滤器类别,估计的有害率下降后稳定在零以上,而不是收敛到零,表明存在一个持续的实证危害下限。我们进一步观察到,这些残留危害在多个模型和过滤器类型中持续存在,表明有界过滤器无法可靠地检测或中和基础模型分布支持的所有有害输出,尤其是当有害性与其他有用能力纠缠在一起时(Casper 等人,2023 (https://arxiv.org/html/2607.18295#bib.bib2);Ball 等人,2025 (https://arxiv.org/html/2607.18295#bib.bib11))。 这项工作做出了三项贡献。首先,我们提供了一个统一的实证框架,用于衡量在有界安全过滤器下真实 LLM 的危害下限,使用了公开可复现的提示、模型和指标。其次,我们提供了跨模型的证据,表明支持保留对齐与计算受限过滤器的结合留下了非零的有害行为残留概率,即使过滤器得到加强且查询预算增加。第三,我们建议,要弥合这一残留安全差距,可能需要改变模型能够表征的内容或推理方式的方法,或者将危害相关的不变量更直接地暴露给下游安全组件,而不是仅仅依赖于输出级别的概率重塑和更强的外部过滤器(Casper 等人,2023 (https://arxiv.org/html/2607.18295#bib.bib2);Qiu,2025 (https://arxiv.org/html/2607.18295#bib.bib4);Ball 等人,2025 (https://arxiv.org/html/2607.18295#bib.bib11))。 ## 2 相关工作 ### 2.1 RLHF 与基于偏好的对齐的局限性 基于人类反馈的强化学习(RLHF)是大型语言模型后训练对齐的主导范式(Ouyang 等人,2022 (https://arxiv.org/html/2607.18295#bib.bib1))。近期工作研究了其结构性局限。Casper 等人(2023 (https://arxiv.org/html/2607.18295#bib.bib2))指出了 RLHF 中的基本失败模式,区分了可处理的奖励建模问题与由人类评估者无法可靠评估超人类或长周期输出而导致的不可约局限性。他们的分析强调了系统性代理博弈和奖励误设,指出即使在扩展情况下,RLHF 也会引入持续的对齐误差(Casper 等人,2023 (https://arxiv.org/html/2607.18295#bib.bib2))。 对偏好聚合的形式化分析进一步揭示了基于奖励的对齐中的结构性弱点。Hollender 和 Kraiczy(2026 (https://arxiv.org/html/2607.18295#bib.bib3))表明,从二元比较中训练的线性奖励模型可能违反帕累托一致性,这意味着在所有对齐维度上都严格更差的响应可能获得更高的学习奖励。类似地,Qiu(2025 (https://arxiv.org/html/2607.18295#bib.bib4))将对齐框架化为代表性社会选择,并证明了有限样本偏好聚合下的 Arrow 式不可能性结果,使用 VC 维度论证来展示在泛化约束下自然聚合公理之间的不兼容性(Hollender 和 Kraiczy,2026 (https://arxiv.org/html/2607.18295#bib.bib3);Qiu,2025 (https://arxiv.org/html/2607.18295#bib.bib4))。 近期理论研究比较了概率倾斜和 KL 正则化方法在对齐中的效果。分析了 DPO 和 PPO 风格的更新,表明没有强 KL 控制的概率重新加权可能引起分布偏移下的不稳定性。Hollender 和 Kraiczy(2025 (https://arxiv.org/html/2607.18295#bib.bib6))提供了 KL 正则化 RLHF 与多个参考模型的收敛特征和样本复杂度边界,强调了稳定对齐所需的非平凡查询需求(Hollender 和 Kraiczy,2025 (https://arxiv.org/html/2607.18295#bib.bib6))。这些分析强化了 RLHF 风格的重新加权倾向于保留潜在行为支持,并且对分布失配仍然敏感,这激发了我们对支持保留对齐算子的关注。 ### 2.2 对齐中的不可能性与负数结果 越来越多的研究工作致力于 AI 对齐的形式化不可能性结果。受社会选择启发的研究表明,在现实学习约束下,没有任何聚合机制能同时满足自然的公平性和独立性公理(Qiu,2025 (https://arxiv.org/html/2607.18295#bib.bib4))。其他工作强调基于奖励优化的欠指定性和结构性限制,认为即使模型和数据集扩展,失调也可能持续存在(Casper 等人,2023 (https://arxiv.org/html/2607.18295#bib.bib2))。这些结果表明,对齐目标可能仍然不完整或内部不一致,并且某些失败源于问题形式化本身,而不仅仅来自优化噪声。 我们的贡献侧重点不同:我们不进行偏好聚合公理的规范比较,而是分析当对齐算子保留支持并且围绕 LLM 的安全机制作为计算有界过滤器实现时所产生的结构性限制。这一视角将高层不可能性结果与部署的 LLM 堆栈的具体架构联系起来,其中支持保留的后训练与有界提示和输出过滤器相结合。 ### 2.3 过滤的计算与统计困难性 学习理论中的统计查询(SQ)下界表明,有限访问算法需要的查询复杂度与目标假设类别的 SQ 维度或 VC 维度成比例,并且误差通常最多以 d/m 的量级衰减,其中 d 是复杂度,m 是查询数量(Qiu,2025 (https://arxiv.org/html/2607.18295#bib.bib4))。这些信息论障碍直接适用于过滤机制,其中危害相关结构并未明确暴露,安全机制必须通过粗粒度特征或期望值而非直接访问真实危害标签来运作。 与此同时,密码学构造(如伪随机函数族)已被用来展示计算有界与无界学习者之间的分离,表明在没有辅助结构的情况下,多项式时间算法可能无法实现分类或检测(Ball 等人,2025 (https://arxiv.org/html/2607.18295#bib.bib11))。该项工作中的隐藏特征约简形式化了这样的场景:即使一个能够访问秘密密钥的更强大生成器可以区分有害与良性行为,一个高效的外部过滤器却无法可靠地做到。我们的理论框架在对齐背景下采用了这一模板,我们的实证流程通过将真实 LLM 与黑盒、白盒和 SQ 风格过滤器在显式查询预算下相结合,实例化了这些分离中的有界过滤端。 ### 2.4 对 LLM 的越狱与对抗性攻击 近期工作表明,大型语言模型仍然极易受到日益复杂的越狱攻击,这些攻击利用了提示结构和内部推理过程。多轮攻击框架,如 Mastermind,通过迭代规划、执行和反思,逐步将模型输出引向有害行为,显著优于单次攻击策略(Li 等人,2026 (https://arxiv.org/html/2607.18295#bib.bib12))。 其他方法利用了推理相关的漏洞,特别是在使用思维链(CoT)生成的模型中。这些攻击诱导模型构建中间推理步骤,这些步骤隐含地证明或语境化了有害输出,有效利用了模型自身的推理过程来对抗其对齐约束。 混合对抗方法进一步表明,将语义提示变化与基于优化的技术相结合,即使在有限的计算预算下也能实现高攻击成功率,突显了跨模型架构和规模的持续漏洞(Ahmad 等人,2026 (https://arxiv.org/html/2607.18295#bib.bib13))。 为了说明这些攻击策略如何具体体现,我们突出显示了在最近对最先进模型评估中观察到的代表性越狱模式: #### 多轮渐进式引导。 攻击者以良性的教育框架开始(例如,“为了网络安全课程,解释 SQL 注入的工作原理”),然后在后续轮次中逐步缩小到操作细节(“现在展示用于登录绕过的具体载荷”),直到模型提供可利用的漏洞代码。每个单独的轮次对有界过滤器来说可能看似无害,但累积的轨迹引发了单轮分类器会标记的有害内容。此模式与 Mastermind 框架的迭代规划策略相一致(Li 等人,2026 (https://arxiv.org/html/2607.18295#bib.bib12))。 #### 思维链利用。 当提示包含推理诱导前缀(如“让我们一步步思考如何理论上......”)时,具备思维链能力的模型可以被引导在内部合理化有害指令。推理轨迹
相似文章
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
安全回应至关重要:输出感知安全护栏缓解多模态大语言模型过度拒绝问题
本文提出了一种面向多模态大语言模型的输出感知安全护栏方法,利用隐藏状态表示和多实例对比学习在生成前预测不安全输出,大幅减少过度拒绝同时保持安全性。该方法仅在实际回答可能有害时进行干预,从而保留模型的实用性。
GradShield:保持对齐的微调
GradShield 引入了一种基于原则的过滤方法,通过计算微调隐式有害性评分(FIHS)并使用自适应阈值去除有害数据,在微调过程中保持 LLM 的安全对齐,在保持实用性的同时实现较低的攻击成功率。
从正则表达式中隔离LLM对齐:对抗性变异下的零覆盖和度量依赖分歧
本文研究了在旨在绕过正则表达式的对抗性探针下,LLM对齐是否提供超出正则表达式过滤器的额外覆盖。通过一项移除正则表达式过滤器的消融研究,发现对齐的贡献是度量依赖的:在自然语言有害请求上零覆盖增益,但在对抗性构造的变体上可检测出拒绝。
形式对齐而非语义对齐:低资源孟加拉语贬损言语中LLM安全性的理解-遏制解耦
这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。