LiSA:通过保守策略归纳实现终身安全适应
摘要
LiSA(终身安全适应)是一个框架,通过将偶尔的失败转化为可重用的策略抽象,并利用基于证据的置信门控在稀疏和噪声反馈下保持良好性能,从而增强AI代理的安全护栏,解决实际部署中对自适应安全的关键需求。
查看缓存全文
缓存时间: 2026/05/15 12:25
论文页面 - LiSA:通过保守策略归纳实现终身安全适应
来源:https://huggingface.co/papers/2605.14454
摘要
LiSA 通过将偶发故障转化为可复用的策略抽象,并利用基于证据的置信门控,在稀疏和噪声反馈条件下提升性能,从而为 AI 智能体实现自适应安全护栏。
随着 AI 智能体从聊天界面转向读取私有数据、调用工具和执行多步骤工作流的系统,护栏 (https://huggingface.co/papers?q=guardrails) 成为防范具体部署危害的最后一道防线。在这些场景中,护栏故障不再仅仅是回答质量错误:它们可能导致秘密泄露、授权不安全操作或阻止合法工作。最棘手的故障往往是上下文相关的:一个操作是否可接受,取决于本地隐私规范、组织策略以及用户期望,而这些都难以在部署前进行完整规定。这造成了一个实际差距:护栏 (https://huggingface.co/papers?q=guardrails) 必须适应其自身的运行环境,但部署反馈通常仅限于稀疏、嘈杂的用户报告故障,且反复微调往往不切实际。为弥补这一差距,我们提出了 LiSA(终身安全适应),这是一个保守策略归纳 (https://huggingface.co/papers?q=policy%20induction) 框架,通过结构化记忆 (https://huggingface.co/papers?q=structured%20memory) 改进固定的基础护栏。LiSA 将偶发故障转化为可复用的策略抽象 (https://huggingface.co/papers?q=policy%20abstractions),使得稀疏报告能够泛化到单个案例之外;添加冲突感知局部规则 (https://huggingface.co/papers?q=conflict-aware%20local%20rules),以防止在混合标签上下文中过度泛化;并通过后验下界 (https://huggingface.co/papers?q=posterior%20lower%20bound) 应用基于证据的置信门控 (https://huggingface.co/papers?q=evidence-aware%20confidence%20gating),使得记忆复用随累积证据而非仅凭经验准确率进行缩放。在 PrivacyLens+、ConFaide+ 和 AgentHarm 上,LiSA 在稀疏反馈 (https://huggingface.co/papers?q=sparse%20feedback) 下始终优于强大的基于记忆的基线 (https://huggingface.co/papers?q=memory-based%20baselines),在噪声用户反馈 (https://huggingface.co/papers?q=noisy%20user%20feedback) 下(即使标签翻转率达 20%)仍保持鲁棒性,并推动了延迟-性能前沿超越骨干模型扩展。最终,LiSA 提供了一条实用路径,以确保 AI 智能体免受现实世界长尾边缘风险的不可预测影响。
查看 arXiv 页面 (https://arxiv.org/abs/2605.14454)查看 PDF (https://arxiv.org/pdf/2605.14454)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.14454)
在您的智能体中获取此论文:
hf papers read 2605.14454
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.14454,以便从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.14454,以便从此页面链接。
引用此论文的 Space0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.14454,以便从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
请将此论文添加到收藏 (https://huggingface.co/new-collection) 中,以便从此页面链接。
相似文章
通过自适应安全约束实现非平稳环境下的安全持续强化学习
提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架采用三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。在模拟驾驶环境中的评估表明,在分布偏移下,该框架减少了安全违规,同时保持了竞争性的性能。
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
基于平滑安全结构化策略组合的安全在线学习
本文提出 AutoSafe,一种面向安全在线强化学习的安全感知策略架构,将结构化的安全监控与干预直接集成到动作生成中,实现性能和安全性行为之间平滑的、依赖于风险的过渡,在基准测试和物理 cart-pole 系统上得到了验证。
AISA:用于高速公路施工持续改进的AI安全助手框架
本文提出了AISA,一个利用大型语言模型对施工事故叙述进行分类并检索相关安全信息的AI框架,旨在提升高速公路施工安全规划,特别注重本地推理以保障隐私和降低成本。
使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税
本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。