Tag
Mistral AI releases Shieldstral, a 3B open-weights multimodal safety classifier that treats content moderation as a policy-adaptive question-answering task, outperforming models up to 7x its size without retraining.
Semalith v1.4 is a compact 184M parameter DeBERTa-v3 safety classifier that excels at prompt-injection detection with zero false positives on benign agentic prompts, while also handling general harm and financial compliance in a single pass, outperforming Llama-Guard-3-8B at 44x fewer parameters.
Shieldstral is a 3B parameter multimodal safety classifier that achieves state-of-the-art performance on safety benchmarks by formulating content moderation as a binary question-answering task, matching or outperforming models nearly 7 times its size.
Mistral AI releases Shieldstral-1.0-3B, a compact multimodal safety classifier that adapts to natural-language safety policies at inference time, supporting text, image, and text+image moderation.
Gnosys Labs introduces an autonomous model engineering method that improves classifiers under label scarcity, outperforming standard optimizers like GEPA on the ToxicChat benchmark.
OpenAI releases gpt-oss-safeguard, open-weight reasoning models for safety classification tasks available in 120B and 20B sizes under Apache 2.0 license. The models use chain-of-thought reasoning to classify content according to developer-provided policies at inference time, enabling flexible and explainable content moderation.