adversarial-training

Tag

Cards List
#adversarial-training

Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents

arXiv cs.AI ↗ · 4d ago Cached

The paper proposes AdvRole, an adversarial closed-loop curriculum framework for training role-playing agents in large language models, which evolves scenario pools to improve performance on benchmarks.

0 favorites 0 likes
#adversarial-training

DART: Distributional Adversarial Recurrent Training for Algorithm Learning

arXiv cs.LG ↗ · 2026-09-10 Cached

DART proposes a distributional adversarial training framework for recurrent reasoning models, improving their robustness and performance on structured problems by using a local target distribution instead of single-point supervision.

0 favorites 0 likes
#adversarial-training

RL-ADA: A World-Feedback Framework for Adversarially Robust Enterprise Dialogue Agents

arXiv cs.CL ↗ · 2026-09-04 Cached

RL-ADA is a co-evolutionary framework that replaces human labels with world feedback for training adversarially robust enterprise dialogue agents, using reinforcement learning to improve performance without annotation data.

0 favorites 0 likes
#adversarial-training

RL-FAT: Reinforcement Learning for Fair Adversarial Training

arXiv cs.LG ↗ · 2026-09-01 Cached

RL-FAT is a reinforcement learning framework for fair adversarial training that improves robustness while reducing class-wise disparities. Experiments demonstrate competitive accuracy and better fairness compared to standard methods.

0 favorites 0 likes
#adversarial-training

Adversarial Training Without Input Gradients via Low-Rank Householder Expansions

arXiv cs.LG ↗ · 2026-08-28 Cached

This paper proposes a novel adversarial training method that eliminates input gradients by using low-rank Householder expansions, reducing computational cost while achieving robustness comparable to standard techniques for small perturbations.

0 favorites 0 likes
#adversarial-training

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

Hugging Face Daily Papers ↗ · 2026-08-25 Cached

This paper introduces AnTrap, a benchmark for evaluating the robustness of Android GUI agents against runtime anomalies, revealing universal vulnerabilities and differentiating between learnable traps and intrinsic reasoning limitations.

0 favorites 0 likes
#adversarial-training

Continuous Adversarial MeanFlow Transfer

arXiv cs.LG ↗ · 2026-08-21 Cached

This paper proposes MeanFlow-Transfer (MF-T) and Continuous Adversarial MeanFlow (CAMF) to unify the adaptation and acceleration of pretrained diffusion and flow models, enabling high-quality few-step generation on new domains with limited data.

0 favorites 0 likes
#adversarial-training

Learning What to Fail On: Failure-Mode Contextual Bandits for Adversarial Data Curation

arXiv cs.CL ↗ · 2026-08-20 Cached

The paper introduces a failure-aware adversarial retrieval-augmented framework using contextual bandits to improve robustness in natural language understanding, with significant improvements on benchmarks like SNLI, ANLI, and MultiNLI.

0 favorites 0 likes
#adversarial-training

PixRestore: Unified Image Restoration via Pixel Diffusion Transformer

Hugging Face Daily Papers ↗ · 2026-08-17 Cached

PixRestore is a VAE-free pixel-space diffusion transformer for unified image restoration, achieving high fidelity and efficiency via flow matching and adversarial fine-tuning to a one-step generator.

0 favorites 0 likes
#adversarial-training

Adversarial Causal Intervention Falsification

arXiv cs.LG ↗ · 2026-08-10 Cached

Introduces Adversarial Causal Intervention Falsification (ACIF), a sequential game where a structural causal generator proposes observational and interventional distributions while an adversarial experimentalist selects interventions to falsify it. The paper provides theoretical guarantees, including finite-sample convergence and model-selection, bridging causal generative modeling, active discovery, and experimental design.

0 favorites 0 likes
#adversarial-training

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates

arXiv cs.LG ↗ · 2026-08-03 Cached

This paper proposes computation-efficient strategies for latent adversarial training (LAT) of LLMs, using low-rank representation fine-tuning and circuit-guided surrogate models to reduce per-step FLOPs by 48.1% while requiring only 0.0118% trainable parameters.

0 favorites 0 likes
#adversarial-training

RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning

arXiv cs.LG ↗ · 2026-07-30 Cached

RAGuard is a layered defense framework for Retrieval-Augmented Generation (RAG) systems that uses adversarial fine-tuning of the retriever and a label-free filter (ZKIP) to achieve zero attack success against corpus poisoning, maintaining high retrieval accuracy.

0 favorites 0 likes
#adversarial-training

GPT-Red: Automated Red Teaming via Self-Play at Scale

Hugging Face Daily Papers ↗ · 2026-07-28 Cached

This paper introduces GPT-Red, an automated red-teaming agent trained via self-play at scale to discover novel prompt injection attacks against frontier LLMs, and uses it to adversarially train GPT-5.6, achieving the largest documented LLM safety training run.

0 favorites 0 likes
#adversarial-training

Making Open-Source Text LLM Watermarks Durable Against Merging

arXiv cs.CL ↗ · 2026-07-24 Cached

This paper proposes Merge-Adversarial Training to make text watermarks in open-source LLMs survive model merging, outperforming baselines while preserving downstream capabilities.

0 favorites 0 likes
#adversarial-training

Fence: Specialized SLM Guardrails for LLM Applications

arXiv cs.AI ↗ · 2026-07-22 Cached

Fence proposes using Small Language Models trained on high-quality synthetic data as specialized guardrails for LLM applications, demonstrating performance gains over prompt-based LLM guardrails.

0 favorites 0 likes
#adversarial-training

@OpenAI: Introducing GPT-Red An internal automated red teamer on a mission to find our models’ prompt injection vulnerabilities …

X AI KOLs ↗ · 2026-07-15 Cached

OpenAI introduces GPT-Red, an automated red-teaming model that finds prompt injection vulnerabilities at scale and is used to adversarially train models like GPT-5.6 Sol, achieving 6x fewer failures on hard prompt injection benchmarks.

0 favorites 0 likes
#adversarial-training

Efficient Safety Alignment of Language Models via Latent Personality Traits

arXiv cs.LG ↗ · 2026-07-10 Cached

Introduces Latent Personality Alignment (LPA), a lightweight adversarial training method that uses 66 psychometric personality statements to achieve near-zero attack success rates on jailbreak attacks without degrading utility, requiring only minutes on a single GPU.

0 favorites 0 likes
#adversarial-training

Robustness Meets Uncertainty: Evidential Adversarial Training for Robust Selective Classification

arXiv cs.LG ↗ · 2026-07-07 Cached

This paper introduces Evidential Adversarial Training (EV-AT), a method that improves the robustness-uncertainty trade-off in classifiers by combining an evidence-based loss with robust evidence alignment, achieving state-of-the-art results on selective classification benchmarks.

0 favorites 0 likes
#adversarial-training

@dair_ai: Highly-recommended read from MIT on the part of RL with verifiable rewards that everyone keeps hitting. RLVR only optim…

X AI KOLs Timeline ↗ · 2026-07-03 Cached

This paper from MIT proposes an adversarial generator-discriminator framework that combines verifiable rewards with a learned signal from human demonstrations to address issues like diversity collapse, unnatural responses, and reward hacking in RLVR training of language models.

0 favorites 0 likes
#adversarial-training

GRAPE: Guided Parameter-Space Evolution for Compact Adversarial Robustness

arXiv cs.LG ↗ · 2026-06-16 Cached

GRAPE is a training framework that progressively exposes parameter space during adversarial training, achieving higher robust accuracy with fewer parameters compared to fixed-structure methods on CIFAR-10.

0 favorites 0 likes
Next →
← Back to home

Submit Feedback