dialogue-critic

Tag

Cards List
#dialogue-critic

Robust Critics: Defending LLMs Against Multi-Turn Attacks

arXiv cs.AI · 2026-07-24 Cached

This paper proposes Dialogue Critic Guided Sampling (DCGS), a framework that defends LLMs against multi-turn adversarial attacks by inferring user intent from conversation history and using value/regret-based critics to score responses, achieving improved robustness without fine-tuning.

0 favorites 0 likes
← Back to home

Submit Feedback