OpenGuardrails: 一个开源的上下文感知AI护栏平台

Papers with Code Trending 论文

摘要

OpenGuardrails 是一个面向AI安全的开源平台,通过统一模型提供上下文感知的内容安全与操纵检测(例如提示注入、越狱),以及一个独立的NER管道用于数据泄露识别。它在安全基准测试上取得了最先进的性能,并支持私有化、企业级部署。

随着大型语言模型(LLMs)越来越多地集成到实际应用中,保护它们免受不安全、恶意或泄露隐私的内容的侵害变得至关重要。 我们提出了OpenGuardrails,这是第一个同时提供上下文感知的安全与操纵检测模型以及可部署的综合AI护栏平台的开源项目。 OpenGuardrails 防护内容包括安全风险、模型操纵攻击(例如提示注入、越狱、代码解释器滥用以及恶意代码的生成/执行)以及数据泄露。 内容安全和模型操纵检测由一个统一的大模型实现,而数据泄露的识别与编辑则由一个独立的轻量级NER管道(例如Presidio风格的模型或基于正则表达式的检测器)完成。 该系统可以作为安全网关或基于API的服务进行部署,并提供企业级、完全私有的部署选项。 OpenGuardrails 在安全基准测试上取得了最先进的性能,在英语、中文和多语言任务的提示与响应分类方面表现出色。 所有模型均在Apache 2.0许可证下发布,供公众使用。
查看原文
查看缓存全文

缓存时间: 2026/05/25 06:31

论文页面 - OpenGuardrails:一个开源的上下文感知AI护栏平台

来源:https://huggingface.co/papers/2510.19169 发布于 2025年10月22日

摘要

OpenGuardrails 是一个开源项目,提供统一的内容安全与模型操控检测模型,并包含一个独立的NER管道用于数据泄露识别,支持企业级部署选项。

随着大语言模型(https://huggingface.co/papers?q=large%20language%20models)(LLMs(https://huggingface.co/papers?q=LLMs))越来越多地集成到现实世界的应用中,保护它们免受不安全、恶意或违反隐私内容的侵害变得至关重要。我们提出OpenGuardrails(https://huggingface.co/papers?q=OpenGuardrails),这是第一个开源项目,同时提供上下文感知安全(https://huggingface.co/papers?q=context-aware%20safety)与操控检测(https://huggingface.co/papers?q=manipulation%20detection)模型以及可部署的综合性AI护栏平台。OpenGuardrails(https://huggingface.co/papers?q=OpenGuardrails)可抵御内容安全风险、模型操控攻击(例如提示注入(https://huggingface.co/papers?q=prompt%20injection)、越狱(https://huggingface.co/papers?q=jailbreaking)、代码解释器滥用(https://huggingface.co/papers?q=code-interpreter%20abuse)以及恶意代码的生成/执行)和数据泄露(https://huggingface.co/papers?q=data%20leakage)。内容安全与模型操控检测(https://huggingface.co/papers?q=manipulation%20detection)由统一大模型(https://huggingface.co/papers?q=unified%20large%20model)实现,而数据泄露的识别与编辑则由独立的轻量级NER管道(https://huggingface.co/papers?q=lightweight%20NER%20pipeline)(例如Presidio风格模型(https://huggingface.co/papers?q=Presidio-style%20models)或基于正则表达式的检测器(https://huggingface.co/papers?q=regex-based%20detectors))完成。该系统可部署为安全网关(https://huggingface.co/papers?q=security%20gateway)或基于API的服务(https://huggingface.co/papers?q=API-based%20service),并提供企业级、完全私有的部署选项。OpenGuardrails(https://huggingface.co/papers?q=OpenGuardrails)在安全基准测试中达到了最先进(https://huggingface.co/papers?q=state-of-the-art)(SOTA)性能,在提示词和响应分类(https://huggingface.co/papers?q=response%20classification)方面均表现出色,覆盖英文、中文及多语言任务(https://huggingface.co/papers?q=multilingual%20tasks)。所有模型均以Apache 2.0许可证(https://huggingface.co/papers?q=Apache%202.0%20license)发布供公众使用。

查看arXiv页面(https://arxiv.org/abs/2510.19169)查看PDF(https://arxiv.org/pdf/2510.19169)项目页面(https://openguardrails.com/)GitHub344(https://github.com/openguardrails/openguardrails)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2510.19169)

在你的智能体中获取该论文:

hf papers read 2510\.19169

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型2个

openguardrails/OpenGuardrails-Text-2510 文本生成• 15B• 更新于4月9日 • 1.57k • 10 (https://huggingface.co/openguardrails/OpenGuardrails-Text-2510)

openguardrails/OpenGuardrails-Text-4B-0124 文本生成• 4B• 更新于4月9日 • 103 • 1 (https://huggingface.co/openguardrails/OpenGuardrails-Text-4B-0124)

引用该论文的数据集3个

openguardrails/OpenGuardrailsMixZh_97k 查看器• 更新于2025年10月23日 • 88.5k • 213 • 3 (https://huggingface.co/datasets/openguardrails/OpenGuardrailsMixZh_97k)

qtqtqtqt/OpenGuardrailsMixZh_97k 查看器• 更新于2月3日 • 88.5k • 57 (https://huggingface.co/datasets/qtqtqtqt/OpenGuardrailsMixZh_97k)

ruishen123/OpenGuardrailsMixZh_97k 查看器• 更新于1月14日 • 88.5k • 11 (https://huggingface.co/datasets/ruishen123/OpenGuardrailsMixZh_97k)

引用该论文的Spaces0个

没有Space链接该论文

在Space的README.md中引用arxiv.org/abs/2510.19169以将其链接到此页面。

包含该论文的收藏集0个

没有收藏集包含该论文

将该论文添加到收藏集(https://huggingface.co/new-collection)以将其链接到此页面。

相似文章

具备潜在推理能力的鲁棒高效护栏

arXiv cs.AI

CoLaGuard 是一种新型护栏模型,它将多步安全推理转移到连续潜在空间中,与显式推理基线相比,实现了 12.9 倍的加速和 22.4 倍的 Token 缩减,同时在十个安全基准上匹配宏 F1 性能。