LiSA:通过保守策略归纳实现终身安全适应

Hugging Face Daily Papers 论文

摘要

LiSA(终身安全适应)是一个框架,通过将偶尔的失败转化为可重用的策略抽象,并利用基于证据的置信门控在稀疏和噪声反馈下保持良好性能,从而增强AI代理的安全护栏,解决实际部署中对自适应安全的关键需求。

随着AI代理从聊天界面转向能够读取私人数据、调用工具并执行多步骤工作流的系统,安全护栏成为防御具体部署危害的最后一道防线。在这些场景中,护栏故障不再仅仅是答案质量错误:它们可能泄露机密、授权不安全操作或阻止合法工作。最棘手的故障通常是情境性的:某一行为是否可接受取决于当地隐私规范、组织政策和用户期望,这些因素难以在部署前完全指定。这造成了一个实际鸿沟:安全护栏必须适应其自身的运行环境,然而部署反馈通常仅限于稀疏、带有噪声的用户报告故障,且反复微调往往不切实际。为解决这一鸿沟,我们提出LiSA(终身安全适应),一种通过结构化记忆改进固定基础护栏的保守策略归纳框架。LiSA将偶尔的故障转化为可重用的策略抽象,使稀疏报告能够泛化到个别案例之外;添加冲突感知的局部规则以防止混合标签情境下的过度泛化;并通过后验下界应用基于证据的置信门控,使得记忆重用的程度随累积证据而非单纯的经验准确性增长。在PrivacyLens+、ConFaide+和AgentHarm基准测试中,LiSA在稀疏反馈下始终优于基于记忆的强基线,即使在20%标签翻转率的噪声用户反馈下依然保持稳健,并将延迟-性能边界推至超越骨干模型缩放的限制。最终,LiSA为保护AI代理免受现实世界边缘风险中不可预测的长尾问题提供了一条实用路径。
查看原文
查看缓存全文

缓存时间: 2026/05/15 12:25

论文页面 - LiSA:通过保守策略归纳实现终身安全适应

来源:https://huggingface.co/papers/2605.14454

摘要

LiSA 通过将偶发故障转化为可复用的策略抽象,并利用基于证据的置信门控,在稀疏和噪声反馈条件下提升性能,从而为 AI 智能体实现自适应安全护栏。

随着 AI 智能体从聊天界面转向读取私有数据、调用工具和执行多步骤工作流的系统,护栏 (https://huggingface.co/papers?q=guardrails) 成为防范具体部署危害的最后一道防线。在这些场景中,护栏故障不再仅仅是回答质量错误:它们可能导致秘密泄露、授权不安全操作或阻止合法工作。最棘手的故障往往是上下文相关的:一个操作是否可接受,取决于本地隐私规范、组织策略以及用户期望,而这些都难以在部署前进行完整规定。这造成了一个实际差距:护栏 (https://huggingface.co/papers?q=guardrails) 必须适应其自身的运行环境,但部署反馈通常仅限于稀疏、嘈杂的用户报告故障,且反复微调往往不切实际。为弥补这一差距,我们提出了 LiSA(终身安全适应),这是一个保守策略归纳 (https://huggingface.co/papers?q=policy%20induction) 框架,通过结构化记忆 (https://huggingface.co/papers?q=structured%20memory) 改进固定的基础护栏。LiSA 将偶发故障转化为可复用的策略抽象 (https://huggingface.co/papers?q=policy%20abstractions),使得稀疏报告能够泛化到单个案例之外;添加冲突感知局部规则 (https://huggingface.co/papers?q=conflict-aware%20local%20rules),以防止在混合标签上下文中过度泛化;并通过后验下界 (https://huggingface.co/papers?q=posterior%20lower%20bound) 应用基于证据的置信门控 (https://huggingface.co/papers?q=evidence-aware%20confidence%20gating),使得记忆复用随累积证据而非仅凭经验准确率进行缩放。在 PrivacyLens+、ConFaide+ 和 AgentHarm 上,LiSA 在稀疏反馈 (https://huggingface.co/papers?q=sparse%20feedback) 下始终优于强大的基于记忆的基线 (https://huggingface.co/papers?q=memory-based%20baselines),在噪声用户反馈 (https://huggingface.co/papers?q=noisy%20user%20feedback) 下(即使标签翻转率达 20%)仍保持鲁棒性,并推动了延迟-性能前沿超越骨干模型扩展。最终,LiSA 提供了一条实用路径,以确保 AI 智能体免受现实世界长尾边缘风险的不可预测影响。

查看 arXiv 页面 (https://arxiv.org/abs/2605.14454)查看 PDF (https://arxiv.org/pdf/2605.14454)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.14454)

在您的智能体中获取此论文:

hf papers read 2605.14454

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.14454,以便从此页面链接。

引用此论文的数据集0

没有数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.14454,以便从此页面链接。

引用此论文的 Space0

没有 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.14454,以便从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

请将此论文添加到收藏 (https://huggingface.co/new-collection) 中,以便从此页面链接。

相似文章

通过自适应安全约束实现非平稳环境下的安全持续强化学习

arXiv cs.LG

提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架采用三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。在模拟驾驶环境中的评估表明,在分布偏移下,该框架减少了安全违规,同时保持了竞争性的性能。

基于平滑安全结构化策略组合的安全在线学习

arXiv cs.LG

本文提出 AutoSafe,一种面向安全在线强化学习的安全感知策略架构,将结构化的安全监控与干预直接集成到动作生成中,实现性能和安全性行为之间平滑的、依赖于风险的过渡,在基准测试和物理 cart-pole 系统上得到了验证。

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。