Tag
SAFEGuard is a unified detection framework that uses harmful semantic analysis and fluency measurement to detect optimization-based jailbreak attacks on large language models, outperforming state-of-the-art baselines.