safety-classifier

Tag

Cards List
#safety-classifier

Mistral's Shieldstral: 3B open-weights model for multimodal moderation

Hacker News Top · 2026-08-04 Cached

Mistral AI releases Shieldstral, a 3B open-weights multimodal safety classifier that treats content moderation as a policy-adaptive question-answering task, outperforming models up to 7x its size without retraining.

0 favorites 0 likes
#safety-classifier

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B

arXiv cs.LG · 2026-07-28 Cached

Semalith v1.4 is a compact 184M parameter DeBERTa-v3 safety classifier that excels at prompt-injection detection with zero false positives on benign agentic prompts, while also handling general harm and financial compliance in a single pass, outperforming Llama-Guard-3-8B at 44x fewer parameters.

0 favorites 0 likes
#safety-classifier

Shieldstral

Hugging Face Daily Papers · 2026-07-28 Cached

Shieldstral is a 3B parameter multimodal safety classifier that achieves state-of-the-art performance on safety benchmarks by formulating content moderation as a binary question-answering task, matching or outperforming models nearly 7 times its size.

0 favorites 0 likes
#safety-classifier

mistralai/Shieldstral-1.0-3B

Hugging Face Models Trending · 2026-07-16 Cached

Mistral AI releases Shieldstral-1.0-3B, a compact multimodal safety classifier that adapts to natural-language safety policies at inference time, supporting text, image, and text+image moderation.

0 favorites 0 likes
#safety-classifier

Making Optimization Work When Labels Are Scarce [R]

Reddit r/MachineLearning · 2026-07-02

Gnosys Labs introduces an autonomous model engineering method that improves classifiers under label scarcity, outperforming standard optimizers like GEPA on the ToxicChat benchmark.

0 favorites 0 likes
#safety-classifier

Introducing gpt-oss-safeguard

OpenAI Blog · 2025-10-29 Cached

OpenAI releases gpt-oss-safeguard, open-weight reasoning models for safety classification tasks available in 120B and 20B sizes under Apache 2.0 license. The models use chain-of-thought reasoning to classify content according to developer-provided policies at inference time, enabling flexible and explainable content moderation.

0 favorites 0 likes
← Back to home

Submit Feedback