multi-turn-attacks

Tag

Cards List
#multi-turn-attacks

How to break your AI agent

Reddit r/AI_Agents · 2026-09-08

A practical walkthrough on how to test AI agents with multi-turn attacks to uncover vulnerabilities that seem harmless in isolation but become critical over interactions.

0 favorites 0 likes
#multi-turn-attacks

Before the Script, Set the Stage: How Worldview Simulation Amplifies Psychologically Grounded Persuasion in Multi-Turn Jailbreaking

arXiv cs.CL · 2026-09-03 Cached

The paper introduces Blueprint, a safety-evaluation framework that uses WorldviewSim and Monte Carlo Tree Search to optimize multi-turn jailbreak attacks against large language models, achieving high attack success rates with few queries and revealing model-specific vulnerabilities.

0 favorites 0 likes
#multi-turn-attacks

EvoFlint: An Evolutionary Atlas of Multi-Turn LLM Vulnerabilities

arXiv cs.CL · 2026-09-02 Cached

EvoFlint introduces an evolutionary quality-diversity search method for multi-turn red-teaming of large language models, aiming to map vulnerabilities rather than just break models, achieving high attack success rates on various LLMs.

0 favorites 0 likes
#multi-turn-attacks

Temporal Context Awareness: A Defense Framework Against Multi-turn Manipulation Attacks on Large Language Models

arXiv cs.AI · 2026-08-06 Cached

This paper introduces Temporal Context Awareness (TCA), a defense framework that detects multi-turn manipulation attacks on LLMs by analyzing semantic drift, cross-turn intention consistency, and evolving conversational patterns to mitigate adversarial context-building across dialogues.

0 favorites 0 likes
#multi-turn-attacks

Robust Critics: Defending LLMs Against Multi-Turn Attacks

arXiv cs.AI · 2026-07-24 Cached

This paper proposes Dialogue Critic Guided Sampling (DCGS), a framework that defends LLMs against multi-turn adversarial attacks by inferring user intent from conversation history and using value/regret-based critics to score responses, achieving improved robustness without fine-tuning.

0 favorites 0 likes
#multi-turn-attacks

Been watching real adversarial input hit my detection API for six months. Here's what's actually landing.

Reddit r/LocalLLaMA · 2026-06-08

A six-month analysis of real adversarial inputs reveals that simple multi-turn setups, forward-momentum exploitation, and role redefinition attacks consistently bypass single-message classifiers. The post argues that stateful monitoring of conversational context is more effective than improving one-shot detection.

0 favorites 0 likes
#multi-turn-attacks

The attack on AI agents that no security tool catches

Reddit r/artificial · 2026-05-31

An attacker can bypass security by spreading malicious instructions across multiple messages; Bendex Arc is a tool that tracks session behavior across turns to catch such attacks.

0 favorites 0 likes
← Back to home

Submit Feedback