safety-classifier

标签

Cards List
#safety-classifier

Mistral的Shieldstral:用于多模态审核的3B开放权重模型

Hacker News Top · 2026-08-04 缓存

Mistral AI发布了Shieldstral,这是一个3B开放权重的多模态安全分类器,它将内容审核视为一种策略自适应的问答任务,在无需重新训练的情况下,性能优于其规模7倍的模型。

0 人收藏 0 人点赞
#safety-classifier

Semalith v1.4: 一种经过校准的184M安全分类器,以比Llama-Guard-3-8B少44倍的参数实现最先进的提示注入检测

arXiv cs.LG · 2026-07-28 缓存

Semalith v1.4是一种紧凑型184M参数DeBERTa-v3安全分类器,在良性代理提示上实现零误报的提示注入检测方面表现出色,同时还能在单次处理中覆盖一般危害和金融合规,以少44倍的参数优于Llama-Guard-3-8B。

0 人收藏 0 人点赞
#safety-classifier

Shieldstral

Hugging Face Daily Papers · 2026-07-28 缓存

Shieldstral 是一个 3B 参数的多模态安全分类器,通过将内容审核表述为二值问答任务,在安全基准测试中实现了最先进的性能,匹配或超越近 7 倍于其规模的模型。

0 人收藏 0 人点赞
#safety-classifier

mistralai/Shieldstral-1.0-3B

Hugging Face Models Trending · 2026-07-16 缓存

Mistral AI 发布了 Shieldstral-1.0-3B,一个紧凑的多模态安全分类器,能够在推理时适应自然语言安全策略,支持文本、图像以及文本+图像的审核。

0 人收藏 0 人点赞
#safety-classifier

当标签稀缺时优化如何发挥作用 [R]

Reddit r/MachineLearning · 2026-07-02

Gnosys Labs 推出了一种自主模型工程方法,在标签稀缺的情况下改进分类器,在 ToxicChat 基准测试中优于 GEPA 等标准优化器。

0 人收藏 0 人点赞
#safety-classifier

推出 gpt-oss-safeguard

OpenAI Blog · 2025-10-29 缓存

OpenAI 发布 gpt-oss-safeguard,这是用于安全分类任务的开源权重推理模型,提供 120B 和 20B 两种规格,采用 Apache 2.0 许可证。这些模型使用链式思维推理,在推理时根据开发者提供的策略对内容进行分类,实现灵活且可解释的内容审核。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈