latent-adversarial-training

Tag

Cards List
#latent-adversarial-training

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates

arXiv cs.LG ↗ · 2026-08-03 Cached

This paper proposes computation-efficient strategies for latent adversarial training (LAT) of LLMs, using low-rank representation fine-tuning and circuit-guided surrogate models to reduce per-step FLOPs by 48.1% while requiring only 0.0118% trainable parameters.

0 favorites 0 likes
← Back to home

Submit Feedback