Tag
This paper introduces a certification framework for concept unlearning in text-to-image diffusion models, providing high-confidence guarantees on residual leakage and demonstrating that standard attack-based evaluations often underestimate safety risks.
DiSCO is a training-free, black-box defense for text-to-image models that uses distribution-guided contrastive prompt optimization to prevent generation of Not-Safe-For-Work content, significantly reducing attack success rates.