fluency-measurement

Tag

Cards List
#fluency-measurement

SAFEGuard: Detect Optimization-Based Jailbreak Attacks Through Harmful Semantic Analysis and Fluency Measurement

arXiv cs.LG · 2026-09-10 Cached

SAFEGuard is a unified detection framework that uses harmful semantic analysis and fluency measurement to detect optimization-based jailbreak attacks on large language models, outperforming state-of-the-art baselines.

0 favorites 0 likes
← Back to home

Submit Feedback