STAR-Teaming:面向自动化LLM红队的策略-响应多重网络方法

arXiv cs.CL 论文

摘要

STAR-Teaming提出一种基于多重网络的多智能体框架,实现LLM自动化红队测试,通过将攻击策略组织成可解释的语义社区,在降低算力消耗的同时显著提升攻击成功率。

arXiv:2604.18976v1 公告类型:新 摘要:尽管大语言模型(LLM)已被广泛应用,其仍易被越狱提示诱导输出有害或不当内容。本文提出STAR-Teaming,一种全新的黑盒自动化红队框架,可高效生成此类提示。STAR-Teaming将多智能体系统(MAS)与策略-响应多重网络相结合,利用网络驱动优化采样有效攻击策略。该网络方法将高维嵌入空间转化为可处理结构,带来两大优势:提升LLM战略漏洞的可解释性,并通过将搜索空间组织成语义社区避免冗余探索,从而加速高效策略发现。实验结果表明,STAR-Teaming显著优于现有方法,以更低计算成本实现更高攻击成功率(ASR)。大量实验验证了多重网络的有效性与可解释性。代码开源地址:https://github.com/selectstar-ai/STAR-Teaming-paper
查看原文
查看缓存全文

缓存时间: 2026/04/22 08:29

# STAR-Teaming:面向自动化 LLM 红队的策略-响应多重网络方法  
来源:https://arxiv.org/html/2604.18976  
MinJae Jung¹ YongTaek Lim¹ Chaeyun Kim¹ Junghwan Kim¹† Kihyun Kim¹† Minwoo Kim¹  
¹ DATUMO INC  

###### 摘要  
尽管大型语言模型(LLM)已被广泛使用,它们仍然容易受到越狱提示的影响,这些提示可能诱导出有害或不适当的响应。本文提出 STAR-Teaming,一种新颖的黑盒自动化红队框架,能够高效生成此类提示。STAR-Teaming 将多智能体系统(MAS)与策略-响应多重网络相结合,并采用网络驱动的优化来对有效攻击策略进行采样。该网络方法将原本难以处理的高维嵌入空间转化为可解的结构,带来两大优势:提升对 LLM 策略性漏洞的可解释性,并通过将搜索空间组织成语义社区避免重复探索,从而加速有效策略的搜寻。实验结果表明,STAR-Teaming 在攻击成功率(ASR)和计算开销上均显著优于现有方法。大量实验验证了多重网络的有效性与可解释性。代码已开源:https://github.com/selectstar-ai/STAR-Teaming-paper  
**警告**:本文包含可能令人不适的模型输出。  

STAR-Teaming:面向自动化 LLM 红队的策略-响应多重网络方法  
MinJae Jung¹ YongTaek Lim¹ Chaeyun Kim¹ Junghwan Kim¹† Kihyun Kim¹† Minwoo Kim¹†  
¹ DATUMO INC  

## 1 引言  
大型语言模型在众多任务中表现亮眼(Achiam et al., 2023;Team et al., 2023;Touvron et al., 2023),并被用于解决现实挑战(Costa-Jussà et al., 2022;Schick et al., 2023)。随着其部署扩展到安全关键领域(Singhal et al., 2023;Li et al., 2023),确保模型行为稳健且负责任成为核心关切。特别是,评估 LLM 面对有害、非法或暴力提示时的响应已不可或缺(Wei et al., 2023;Zou et al., 2023;Lin et al., 2025)。这促使红队方法受到关注,用于评估模型对越狱式攻击的鲁棒性。  

为应对日益严峻的安全挑战,近期研究从人工红队转向自动化红队,以实现可扩展、系统化的评估。这些方法大致分为两类:基于优化的攻击(Zou et al., 2023;Chao et al., 2023;Liu et al., 2023;Guo et al., 2024;Mehrotra et al., 2024;Liao and Sun, 2024)和基于策略的攻击(Zeng et al., 2024;Shen et al., 2024;Samvelyan et al., 2024;Jin et al., 2024;Anil et al., 2024a;Liu et al., 2024)。通过反复查询模型,这些方法能在极少人工干预下大规模发现漏洞。  

尽管有效,现有方法面临两大局限:  
1. 多数方法因反复查询或基于强化学习的优化而消耗大量计算资源,限制了可扩展性。  
2. 策略类方法虽引入人工总结的越狱模板,却缺乏对“为何有效”的透明解释。它们通常仅按嵌入相似度采样,未分析成功背后的因果模式,导致攻击难以精进,模型漏洞难以洞察。  

因此,自动化攻击在**效率**与**可解释性**上仍有不足。  

为此,我们提出 STAR-Teaming(Strategy-Response multiplex network Approach to automated Red-Teaming)。其核心是构建一个多重网络,显式刻画攻击策略与 LLM 响应间的统计关系。该结构服务于两大目标:  
- 通过结构化社区探索高效采样有前景的策略,避免相似度方法常见的过采样问题;网络结构便于调整搜索空间大小,并支持策略的直观编辑。  
- 提供可解释性:识别在何种模型场景下哪类策略持续诱发有害行为。  

如图 1 所示,STAR-Teaming 从历史攻击日志构建策略-响应网络,识别策略社区 H_s 与响应社区 G_r,并估计连接它们的映射矩阵 Z。该矩阵指导后续策略采样,并在攻击过程中持续更新,实现自适应提升。映射以二维矩阵形式呈现,元素量化策略社区与响应社区的交互强度,极具可解释性。  

与此前固定嵌入数据库检索上下文的做法不同,STAR-Teaming 将策略选择表述为优化问题:基于观测到的成败,按概率在社区层面采样,从而生成更多样、可解释的攻击。关键之处在于,我们学习的是覆盖多样策略的有效概率分布,而非单个策略。  

主要贡献如下:  
- **新颖的红队框架**:提出 STAR-Teaming,通过多重网络建模策略-响应统计关系,并支持模块化动态扩展,在运行时吸收新兴攻击模式。  
- **策略选择优化**:将策略选择统一为优化任务,实现高效采样与自适应学习。  
- **高效且有效**:在攻击成功率(ASR)和时间效率上显著超越 SOTA 基线。  

## 2 相关工作  
对抗提示生成近期研究主要分为基于优化与基于策略两类。  

**基于优化的方法** 把 LLM 视为白盒,通过迭代查询、梯度更新或损失反馈生成越狱提示。代表工作有 GCG(Zou et al., 2023)、AmpleGCG(Liao and Sun, 2024)、COLD-Attack(Guo et al., 2024)。AutoDAN(Liu et al., 2023)用遗传算法精炼 DAN 式提示;PAIR(Chao et al., 2023)利用 LLM 反馈迭代优化;TAP(Mehrotra et al., 2024)进一步引入剪枝与分支加速搜索。  

**基于策略的方法** 使用预定义或习得的攻击模板,追求更高层语义变化。PAP(Zeng et al., 2024)、DAN(Shen et al., 2024)、Many-shot Jailbreaking(Anil et al., 2024a)采用固定模板;Rainbow Teaming(Samvelyan et al., 2024)定义八类策略(情感、间接提示等)。AutoDAN-Turbo(Liu et al., 2024)通过多智能体循环迭代发现新策略。这类方法语义多样、可解释性好,但模块多、计算开销高,且固定结构难以适应新场景(Lin et al., 2025)。此外,顺序或基于嵌入的策略选择存在搜索低效、语义相似与攻击成功不一致的问题,导致 ASR 偏低。  

我们提出 STAR-Teaming,结合策略-响应多重网络与统计 grounded 采样模块,兼顾高 ASR 与时间效率。  

## 3 STAR-Teaming  
### 3.1 总体框架  
如图 2 所示,方法整合两大核心组件:  
A) 多智能体系统(MAS)  
B) 策略-响应多重网络  

MAS 包含攻击者、目标模型与评分者三个 LLM 智能体,迭代交互:攻击者基于种子与选中策略生成越狱提示;目标模型给出响应;评分者评估是否攻击成功。若分数未达阈值,攻击者更新策略重试,直至最大尝试次数。该循环实现自动化对抗提示生成与评估,人工干预极少。  

为引导策略选择,我们提出基于概率多重网络的新型检索机制。网络利用历史攻击日志构建,建模策略类型聚类与 LLM 响应聚类之间的关系。通过优化聚类间映射矩阵,方法可基于统计模式自适应采样有前景的策略,提升攻击成功率与策略探索多样性。  

后续章节分别详述:3.2 MAS 流程;3.3 多重网络构建;3.4 概率策略采样。  

### 3.2 多智能体系统  
近期自动化红队 MAS 通常包含攻击者、目标与裁判智能体(Mehrotra et al., 2024;Samvelyan et al., 2024;Liu et al., 2024)。STAR-Teaming 的 MAS 循环如下:攻击者 LLM 针对目标 LLM 生成越狱提示;目标响应;评分者 LLM 评估恶意意图与越狱成功。此外,我们引入基于 LLM 的策略提取器,受 AutoDAN-Turbo 启发,从日志中系统识别有效越狱策略,按响应嵌入建立索引数据库,并动态将历史有效策略注入攻击者提示。策略提取器细节见附录 F。  

### 3.3 多重网络构建  
初始阶段无预定义策略,我们利用攻击者 LLM 的随机性(温度 >0)生成首批日志。随后通过 LLM 策略提取器处理,得到结构化〈策略,响应〉对,作为两层网络——响应网络与策略网络——的基础。二者构建流程相同。  

以响应网络为例:  
1. 提取每条目标响应的文本嵌入 e_r。  
2. 计算相似度图 S_r(N_l×N_l 矩阵,元素为余弦相似度)。  
3. 按阈值 α_r 得邻接矩阵 A^r:  
   A^r_{l,l′} = 1 若 S_r_{l,l′}≥α_r,否则 0。  
4. 应用 Leiden 算法(Traag et al., 2019)在 A^r 上识别社区。

相似文章

大语言模型红队测试框架:以忠实性评估为例

arXiv cs.CL

本文提出了一种针对大语言模型的红队测试框架,采用多角色架构系统性地揭示模型漏洞,尤其在忠实性方面。该框架在问答任务中实现了攻击成功率提升7.9%,并强调了架构选择对模型安全性的影响超过参数规模。

GPT-Red:通过规模化自我对弈实现自动化红队测试

Hugging Face Daily Papers

本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。

AdversaBench: 自动化LLM红队测试的多裁判确认与跨模型迁移性

arXiv cs.AI

AdversaBench介绍了一个自动化LLM红队测试流程,该流程使用五个变异算子和一个由三位裁判及元裁判(用于决断平局)组成的评审团来确认失败,揭示了攻击难度因类别而异,并且对抗性提示可以从较小模型迁移到较大模型。