Mistral的Shieldstral:用于多模态审核的3B开放权重模型
摘要
Mistral AI发布了Shieldstral,这是一个3B开放权重的多模态安全分类器,它将内容审核视为一种策略自适应的问答任务,在无需重新训练的情况下,性能优于其规模7倍的模型。
暂无内容
查看缓存全文
缓存时间: 2026/08/04 19:47
# 介绍 Shieldstral。 | Mistral AI 来源:https://mistral.ai/news/shieldstral/ Shieldstral 推出了一款 3B 开放权重多模态安全分类器,通过将内容审核构建为策略自适应问答任务,其性能超越了体积最高达其 7 倍的模型。与传统的护栏模型不同,它在推理时接受自然语言策略,无需重新训练即可统一文本和图像安全评估。它基于 Apache 2.0 协议发布,在各类基准测试中提供校准后的安全评分,并且可在单个 16GB NVIDIA GPU 上高效运行。 **一款 3B 开放权重、策略自适应的多模态安全分类器,在文本安全方面可与体积高达其 7 倍的模型匹敌,并在多模态审核方面树立了新的最先进水平。** “这段内容是否宣扬针对受保护群体的暴力?这张图片对未成年人来说安全吗?助手是否拒绝了请求?”每个发布模型的产品都需要回答这类问题——但正确答案取决于产品、受众和场景。同一内容对于网络安全研究工具可能是合适的,在心理健康平台上却可能有害。大多数护栏模型会将一套固定的危害类别烘焙进权重,因此要针对新的部署环境重新定向就意味着重新训练。而且由于不同应用和领域对安全的定义各不相同,从一开始就不存在一套“正确”的类别可供建模。 Shieldstral 采取了不同的方法:你在推理时将策略写成一条自然语言问题,模型返回一个校准后的安全评分。无需重新训练,用一套界面处理文本和图像,只需一个 token 即可给出判定。请在此处参阅我们的技术报告(https://arxiv.org/abs/2607.25857)。作为与 NVIDIA 及其他组织共同成立的 Open Secure AI Alliance(https://blogs.nvidia.com/blog/open-secure-ai-alliance/)的创始成员,我们今天以 Apache 2.0 开放权重形式发布 **Shieldstral**,可在此处下载(https://huggingface.co/mistralai/Shieldstral-1.0-3B)。 ## 审核即问答 Shieldstral 将内容审核构建为**二元问答任务**。每个请求包含三个部分: - `<instruction>`——评估上下文、严格程度,以及(可选)对何种内容算作不安全内容的定义。 - `<query>`——一个二元是/否问题,例如*“这段内容是否宣扬身体暴力?”* - `<document>`——待判断的内容:一条提示词、一个响应、一组提示词-响应对,或一张可带文本的图像。 在推理时,模型只读取`yes`和`no`的 logits,并通过 softmax 归一化为一个连续的安全评分。这一简单的公式化表述能完成大量工作:它将提示词分类、响应审核、拒绝检测和毒性检测统一为一个问题;它让策略完全存在于提示词中,因此一个检查点即可在部署时适应新的策略。 ## 亮点 - **性能强劲**——在文本安全、拒绝检测、策略适应性和多模态基准测试中,与体积最高达其 7 倍的开源护栏模型持平或更优。 - **自适应且灵活**——单一自然语言界面即可覆盖文本、图像和文本+图像内容,涵盖提示词、响应以及提示词-响应对。策略以自由形式查询提供,并在推理时重新定向,无需重新训练。 - **小巧、基于异构数据源训练**——一个 3B 模型,可在单个 16GB GPU 上运行,使用真实和合成数据训练,涵盖多种标签格式和分类体系,并整合到一个框架中。 - **连续安全评分**——通过单次前向传播返回校准后的 `yes`/`no` 概率,因此你可以按置信度设置阈值或排序,而不是依赖离散标签。 - **开放**——Apache 2.0 权重。 ## 基准测试 我们在四个维度上将 Shieldstral 与体积最高达其 7 倍的开源护栏模型进行对比评估。所有评估样本均未参与训练。 ## 构建方式 核心理念是,只要数据得当,小模型也能胜过更大的模型。要让数据得当,需要解决四个问题: **统一异构数据。** 公开安全数据集在分类体系、标签和标注规范上各不相同——从二元安全/不安全标记到细粒度多标签分类体系。我们使用针对每个数据集的处理器,将所有数据集转换为相同的指令-查询-文档格式,并变换指令、查询和提示词-响应分隔符的措辞,使模型能够跨措辞泛化,而不是过拟合于单一风格。我们还按数据源校准严格程度——对对抗性越狱从严,对响应质量数据从宽——使模型学习*经过校准的*决策边界。这样我们就能整合原本互不兼容的数据源。 **教模型区分,而非死记硬背。** 如果在一个固定的策略标签集上训练,模型只会学会对这些预定义策略进行分类,而无法推理给定策略的精确边界。这会阻碍模型泛化到新策略。因此,我们构造了一组刻意相似、易于混淆的策略,并要求 LLM 将安全文本改写为对比对:每次改写都精心设计为违反其中一条策略但不违反其姊妹策略。这训练模型*区分一段内容具体违反了哪条策略*,这一技能可迁移到推理时未见过、由用户定义的策略上。 **让图像安全有据可依。** 不安全图像无法像文本那样由 LLM 合成,因此视觉安全数据非常稀缺。我们使用通用图像数据集作为高质量负样本,补充有限的审核数据集,通过变异查询来扩充数据集,并使用视觉-语言重排序器过滤每一对图像-查询,以减少错误标签和幻觉。 **融合互补的检查点。** 我们使用 LoRA 进行微调,并通过 SLERP 融合了三个检查点:一个在公开数据上校准过的检查点、一个通过生成数据增加细粒度策略区分能力的检查点,以及基础指令模型。融合后的模型在单一模型中同时恢复了通用策略校准和策略适应性,基础模型的指令遵循能力也迁移到了审核任务上。 **Forge**。我们在 Forge(https://mistral.ai/products/forge/)上端到端构建了 Shieldstral,这是我们的自定义模型训练、对齐和评估平台。Forge 在先进的分布式训练之上管理基础设施、数据和模型分片、指标及日志,使团队能够专注于数据,而数据正是决定安全模型质量的关键。 ## 下一步 Shieldstral 是向自适应上下文审核迈进的一步,而不是让每个产品都套用一种固定的分类体系。我们将继续推进多语言覆盖、更长文档的稳健性以及更广泛的多模态安全——我们也期待看到社区在其基础上构建的内容。 *顺便说一句,我们正在招聘!如果你想帮助让 AI 变得更好,请查看我们的**招聘页面**(https://mistral.ai/careers)。*
相似文章
mistralai/Shieldstral-1.0-3B
Mistral AI 发布了 Shieldstral-1.0-3B,一个紧凑的多模态安全分类器,能够在推理时适应自然语言安全策略,支持文本、图像以及文本+图像的审核。
Shieldstral
Shieldstral 是一个 3B 参数的多模态安全分类器,通过将内容审核表述为二值问答任务,在安全基准测试中实现了最先进的性能,匹配或超越近 7 倍于其规模的模型。
mistralai/Mistral-Medium-3.5-128B
Mistral AI 发布了 Mistral Medium 3.5,这是一款拥有 1280 亿参数的密集多模态模型,具备 256K 上下文窗口、可配置推理能力,并在指令遵循、推理和编程任务方面实现了性能提升。
Mistral发布首款Not-Hotdog模型
Mistral发布Shieldstral-1.0-3B,一款紧凑型安全/审核模型,被戏称为“Not-Hotdog”,旨在过滤有害内容。
@mishig25: 开源真的回来了 http://hf.co/mistralai/Mistral-Medium-3.5-128B…
Mistral AI发布了Mistral Medium 3.5,这是一个开源的128B稠密模型,支持256k上下文、多模态输入、可配置推理和智能体能力。