epistemic-validation

Tag

Cards List
#epistemic-validation

Validity-Aware Jailbreak Evaluation for Large Language Models

arXiv cs.AI · yesterday Cached

This paper proposes SEAV, a verification-centric framework for evaluating jailbreak robustness in large language models by assessing response validity and correctness, significantly reducing false-positive rates in safety assessments.

0 favorites 0 likes
← Back to home

Submit Feedback