超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击
摘要
本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。
arXiv:2608.10239v1 公告类型:新
摘要:生成式AI使社会工程攻击更加流畅、适应性强且可扩展,因此更需要基于大语言模型(LLM)的防御者在持续交互中保护用户。我们研究这些防御者是否能够识别风险的结构性来源,还是仅仅对表面线索做出反应。我们正式定义了信任链定位:识别交互是在主体权威、资产控制、验证充分性还是交易路径上失败。我们构建了一个受控的300例在线租房语料库,涵盖20个场景家族、合法案例、四种结构性失败模式和三种表面条件。在同等语料库上,我们对五款防御模型分别在有状态的逐轮交互和一次性静态场景中进行了评估,每个协议产生1,500次模型-案例评估,共计3,000次。没有模型产生明确的不安全服从行为,但防御有效性差异显著:干预率从0%到96.3%不等。保护性行动与正确的结构性定位经常脱钩,模型有时在识别错误信任组件的同时进行干预,或识别出结构性失败却不采取保护行动。资产控制失败是主要的定位瓶颈,表面敏感性因模型而异,实时与静态差异则取决于具体模型。这些发现表明,仅凭看似安全的行为并不足够;实时防骗能力必须分别衡量干预、时机、结构定位和误报行为。
查看缓存全文
缓存时间: 2026/08/12 08:22
# 超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击 来源:https://arxiv.org/html/2608.10239 由AAAI Press Staff1撰写 AAAI风格贡献:Peter Patel Schneider, Sunil Issar, J. Scott Penberthy, George Ferguson, Hans Guesgen, Francisco Cruz\\equalcontrib\\corresponding, Marc Pujol\-Gonzalez\\equalcontrib\\corresponding 于乔旭1,奥萨马·扎法尔1,亚历山大·内梅切克1,埃尔曼·艾达伊1 ###### 摘要 生成式AI使社会工程攻击更加流畅、自适应且可规模化,这增加了对基于LLM的防御者的需求,使其能够在持续交互过程中保护用户。我们探讨防御者是否能够识别风险的结构性来源,还是仅仅对表面线索作出反应。我们形式化了*信任链定位*:识别交互是在行为者权威、资产控制、验证充分性还是交易路径环节失败。我们构建了一个受控的300案例在线租房语料库,涵盖20个场景族、合法案例、四种结构性失败模式和三种表面条件。五个防御模型在同一语料库上分别在无状态逐轮和一次性静态设置中评估,每种协议产生1,500次模型-案例评估,总计3,000次。没有模型产生明确的不安全遵从,但防御效果差异显著:干预率从0%到96.3%不等。保护性行动和正确的结构性定位经常脱钩,模型有时在识别错误信任组件的同时进行干预,或识别出结构性失败但不采取保护性行动。资产控制失败是主要的定位瓶颈,表面敏感性因模型而异,实时-静态差异取决于模型。这些发现表明,仅凭安全的表象行为是不够的;实时防骗必须分别衡量干预、时机、结构性定位和误报行为。 ## 1 引言 大型语言模型(LLMs)越来越广泛地协助用户进行沟通、信息收集、决策制定和任务完成(Wang等,2024a(https://arxiv.org/html/2608.10239#bib.bib15);Xi等,2023(https://arxiv.org/html/2608.10239#bib.bib16))。与静态分类器不同,它们在多轮交互中运行,基于不完整的证据进行推理,并推荐可能影响用户信任的行动(Wang等,2024b(https://arxiv.org/html/2608.10239#bib.bib17);Guan等,2025(https://arxiv.org/html/2608.10239#bib.bib18);Zhou等,2025(https://arxiv.org/html/2608.10239#bib.bib19))。这带来了一个安全挑战:对手可以在保持合法外观的同时逐步操纵对话上下文。生成式AI通过使社会工程内容更加流畅、自适应和可规模化,进一步放大了这一威胁(Schmitt和Flechais,2024(https://arxiv.org/html/2608.10239#bib.bib20);Heiding等,2024b(https://arxiv.org/html/2608.10239#bib.bib21);Chen等,2025(https://arxiv.org/html/2608.10239#bib.bib22))。 以往工作通常将钓鱼、欺诈和社会工程防御框定为分类任务:给定一条消息、邮件、列表、网页、URL或完整对话,判断其是合法还是欺诈(Yasin和Abuhasan,2016(https://arxiv.org/html/2608.10239#bib.bib46);Safi和Singh,2023(https://arxiv.org/html/2608.10239#bib.bib45);Sehwag等,2024(https://arxiv.org/html/2608.10239#bib.bib47);Yang等,2025(https://arxiv.org/html/2608.10239#bib.bib2))。近期研究将该设置扩展到LLM生成的对话、多轮欺诈基准和基于智能体的模拟(Ai等,2024(https://arxiv.org/html/2608.10239#bib.bib1);Yang等,2025(https://arxiv.org/html/2608.10239#bib.bib2);Kumarage等,2025(https://arxiv.org/html/2608.10239#bib.bib3))。然而,检测到交互可疑并不意味着防御者理解了它为何不安全。模型可能发出通用警告,同时识别错误的行为者、信任未授权的渠道,或未能阻止被重定向的付款、申请或文档路径。 因此,我们研究*实时抵抗能力*:在交互仍在进行时识别风险并作出响应的能力。我们聚焦于在线租房领域,在该领域中,合法和欺诈性对话往往共享表面特征,如远程协调、延迟看房、申请表、文件请求和定金。房产可能是真实的,但沟通者缺乏权限;地址可能有效,但沟通者对资产缺乏控制权;可用的验证可能不充分;或者合法流程可能被重定向到未经授权的交易路径。我们的核心问题是:防御性LLM是否通过结构性推理来抵抗AI生成的骗局,还是主要通过表面层面的谨慎? 我们将*信任链定位*形式化为识别受损组件——身份/权限、资产控制、验证充分性或交易路径。我们构建了一个受控的逐轮基准,其中对话在预定义的信任链失败条件下生成、冻结,并逐步呈现给每个防御者。在每个轮次,防御者选择继续、验证、警告或停止,识别可疑组件,并提供理由。这种设计将保护性行动与正确的结构性诊断分离开来。该基准包含300个固定案例,涵盖20个场景族、五种结构条件和三种表面条件。我们在同一语料库上评估了五个专有和开放权重模型,采用无状态逐轮和一次性完整转录协议,每种协议产生1,500次模型-案例评估,总计3,000次。 我们研究四个研究问题: RQ1:保护性干预和正确的信任链定位是否一致,它们对表面呈现有多敏感? RQ2:在实时交互中,哪些信任链组件最难定位? RQ3:在实时和静态评估之间,不同模型的定位表现有何差异? RQ4:模型在干预覆盖率、干预时机、定位精度和误报行为方面是否表现出不同的抵抗特征? 本文做出三项贡献。首先,我们将信任链定位形式化为一个评估目标,用于区分结构性诊断与通用谨慎。其次,我们引入了一个受控的实时基准,分别衡量干预、时机、定位、不安全遵从、误报和表面敏感性。第三,我们在实时和静态设置下评估了五个防御模型。我们的结果表明,干预和正确识别定位是不同的能力。模型可能在识别错误信任组件的同时进行干预,或正确识别失败但不推荐保护性行动。在该基准中,资产控制案例对强大的托管模型构成了反复出现的定位瓶颈,对表面呈现的敏感性因模型而异,两种评估协议之间的差异取决于模型。这些发现促使我们不仅根据防御性LLM是否警告用户来评估它们,还应考虑它们何时干预以及是否识别出正确的受损信任组件。 ## 2 相关工作 关于在线欺骗的研究长期以来一直考察用户如何解读风险信号,以及自动化系统如何区分恶意交互与良性交互。早期的钓鱼研究表明,用户在判断消息或网站是否可信时,往往依赖不完整或误导性的线索。Dhamija等人发现,钓鱼之所以成功,部分原因在于用户误解读安全指标,并依赖网站的表面特征(Dhamija等,2006(https://arxiv.org/html/2608.10239#bib.bib4))。Jagatic等人(2007(https://arxiv.org/html/2608.10239#bib.bib5))表明,社会情境可以显著提高钓鱼的成功率,而Sheng等人(2010(https://arxiv.org/html/2608.10239#bib.bib6))发现,易感性因用户而异,可以通过培训降低,但无法消除。这些研究确立了欺骗不仅依赖于恶意内容,还依赖于在不确定性下信任线索如何被解读。 大多数钓鱼、骗局和欺诈检测的计算方法将任务框定为分类:给定一封邮件、网页、消息、列表或对话,预测其是良性还是恶意(Yasin和Abuhasan,2016(https://arxiv.org/html/2608.10239#bib.bib46);Safi和Singh,2023(https://arxiv.org/html/2608.10239#bib.bib45);Sehwag等,2024(https://arxiv.org/html/2608.10239#bib.bib47);Yang等,2025(https://arxiv.org/html/2608.10239#bib.bib2))。这种表述支持准确率、精确率、召回率和误报率等标准指标,但不一定能揭示模型是否识别了底层失败机制。检测器可能依赖紧迫性、异常支付语言、糟糕的语法或可疑URL等线索,却未能识别哪个信任关系已受损(Parsons等,2016(https://arxiv.org/html/2608.10239#bib.bib48);Carroll等,2022(https://arxiv.org/html/2608.10239#bib.bib49);Shahriar等,2022(https://arxiv.org/html/2608.10239#bib.bib50))。随着生成式模型减少了历史上使骗局更容易识别的语言伪迹,这一局限性变得更加重要。 近期研究表明,LLM能够生成有说服力且个性化的钓鱼内容,在实验环境中有时接近人类撰写的钓鱼内容(Heiding等,2024c(https://arxiv.org/html/2608.10239#bib.bib7),a(https://arxiv.org/html/2608.10239#bib.bib8);Bethany等,2025(https://arxiv.org/html/2608.10239#bib.bib9))。与我们的设置更相关的是,近期研究考察了对话和多轮环境中LLM驱动的社会工程。SEConvo研究LLM生成的社会工程对话,并考察LLM既作为促进者也作为防御者(Ai等,2024(https://arxiv.org/html/2608.10239#bib.bib1))。SE-VSim使用LLM智能体模拟个性化的多轮社会工程攻击(Kumarage等,2025(https://arxiv.org/html/2608.10239#bib.bib3)),而Fraud-R1评估LLM对多轮欺诈和钓鱼诱导的鲁棒性(Yang等,2025(https://arxiv.org/html/2608.10239#bib.bib2))。更广泛的LLM安全研究评估了拒绝、有害指令遵循、工具使用安全性和对抗性提示下的鲁棒性(Ganguli等,2022(https://arxiv.org/html/2608.10239#bib.bib43);Röttger等,2024(https://arxiv.org/html/2608.10239#bib.bib12);Mazeika等,2024(https://arxiv.org/html/2608.10239#bib.bib13);Ruan等,2024(https://arxiv.org/html/2608.10239#bib.bib14))。这些研究推动了多轮和安全导向评估,但它们主要在对话层面衡量模型是否生成、检测、模拟、拒绝或抵抗有害交互。 我们的工作不同之处在于评估目标。我们评估防御性LLM在无状态逐轮评估下,是否能在后果性请求之前进行干预,并正确识别受损的信任组件。这一区别很重要,因为模型可能警告用户却识别错误的失败机制,或识别正确组件却不推荐保护性行动。例如,在在线租房场景中,模型可能将定金请求标记为有风险,却忽略了相关失败是交易路径替代:所请求的支付、申请、文件传输或通信渠道不属于授权工作流程的一部分。因此,我们的基准分别衡量保护性干预、干预时机、信任链定位、表面敏感性和误报行为。 ## 3 用于实时防骗的信任链框架 我们将*实时防骗能力*定义为防御性LLM从逐步揭示的证据中提供保护性指导,同时正确识别失败的信任关系的能力。与静态诊断不同,实时逐轮评估只向防御者暴露每个检查点时可用的对话前缀。我们使用静态完整转录评估作为对照条件。我们将AI生成的社会工程建模为联系人与防御性LLM智能体之间的实时交互。每个基准案例包含一个固定的、合理的多轮对话,旨在诱导用户产生具有后果性的行为,如提交敏感文件、进行付款、依赖无法验证的权限,或使用未经授权的应用程序或通信渠道。在每个检查点,防御者只能观察到迄今为止可用的公共上下文和对话历史,并逐步作出响应。对抗性对话在评估前生成并验证,然后冻结,以确保每个防御模型收到相同的消息和证据。 我们的框架评估现有的LLM防御者,而非引入新的防御智能体架构。它考察模型是否能区分行为者权威、资产控制、验证充分性和交易路径中的失败,还是主要对紧迫性、支付语言或文件请求等表面线索作出反应。图1(https://arxiv.org/html/2608.10239#S3.F1)概述了整体设置。 图1:受控实时评估框架概述。每个场景实例化为一个经过验证的、冻结的多轮对话,由结构和表面条件定义。在每个检查点,防御者观察可用的对话前缀及其先前的响应,然后输出一个行动和预测的信任链组件。这些输出根据隐藏的真实注册表进行评分。 ### 3.1 信任链设置 每个基准案例包含公共场景上下文、固定的租客和联系人消息序列,以及隐藏的真实注册表。在每个评估检查点,防御者选择四种行动之一:继续、验证、警告或停止。它还会预测受损的信任链组件。实时和静态评估协议以及结构化响应分类法在补充材料第D节中描述,相关评分规则在第E节中提供。对于每个骗局案例,隐藏注册表标记了第一个请求后果性行为的消息。我们将验证、警告和停止视为保护性干预,并衡量第一次干预是否发生在此检查点之前。注册表注释永远不会显示给防御者。真实组件和可定位性标准在补充材料第A.3节中描述,而干预时机在第E节中定义。 我们区分明确的不安全遵从与遗漏的保护。防御者可能避免直接认可有害的付款或文件提交,但在有充分证据表明信任链失败出现后仍然未进行干预。因此,我们分别评估干预覆盖率、请求前干预、正确的信任链定位以及合法交互上的误报。详细的评分规则,包括对停止、无效响应、合法案例误报和不安全遵从的处理,在补充材料第E节中提供。防御者的决策将对照一条*信任链*进行评估:即用户安全继续之前必须成立的关联声明。在租房场景中,联系人必须具有有效权限,必须被授权处理特定房产或申请流程,必须为用户提供充分的独立证据来验证
相似文章
鲁棒批评者:防御LLMs免受多轮攻击
本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。
超越不安全检测:基于反事实锚定的多轮LLM安全故障证据归因
本文提出一种基于反事实锚定的证据归因方法,用于识别多轮LLM对话中的安全故障,实现了高检测性能和低误报率。
LLMs论辩行为的基准测试:针对人身攻击的防御策略研究
本文对大语言模型(LLMs)在论辩对话中处理人身攻击的能力进行了基准测试,揭示了由于安全限制,LLMs优先选择逻辑防御,而不像人类辩手。
LLM时代:迷雾战争下大语言模型推理、外交与可靠性的战略1v1基准测试
介绍Age of LLM,一个回合制1v1基准测试,LLM在带有战争迷雾和外交机制的网格上对战,评估推理、可靠性和战略规划能力。结果显示核速攻战术占主导,且可靠性与获胜之间存在弱关联。