标签
Mistral AI发布了Shieldstral,这是一个3B开放权重的多模态安全分类器,它将内容审核视为一种策略自适应的问答任务,在无需重新训练的情况下,性能优于其规模7倍的模型。
Semalith v1.4是一种紧凑型184M参数DeBERTa-v3安全分类器,在良性代理提示上实现零误报的提示注入检测方面表现出色,同时还能在单次处理中覆盖一般危害和金融合规,以少44倍的参数优于Llama-Guard-3-8B。
Shieldstral 是一个 3B 参数的多模态安全分类器,通过将内容审核表述为二值问答任务,在安全基准测试中实现了最先进的性能,匹配或超越近 7 倍于其规模的模型。
Mistral AI 发布了 Shieldstral-1.0-3B,一个紧凑的多模态安全分类器,能够在推理时适应自然语言安全策略,支持文本、图像以及文本+图像的审核。
Gnosys Labs 推出了一种自主模型工程方法,在标签稀缺的情况下改进分类器,在 ToxicChat 基准测试中优于 GEPA 等标准优化器。
OpenAI 发布 gpt-oss-safeguard,这是用于安全分类任务的开源权重推理模型,提供 120B 和 20B 两种规格,采用 Apache 2.0 许可证。这些模型使用链式思维推理,在推理时根据开发者提供的策略对内容进行分类,实现灵活且可解释的内容审核。