FraudBench:对基于政策的银行代理进行对抗自适应欺诈的压力测试
摘要
FraudBench 是一个可执行基准测试,用于对基于政策的银行代理进行对抗自适应欺诈攻击的压力测试,模拟具有工具、可变状态和内部政策文档的场景。
查看缓存全文
缓存时间: 2026/08/20 10:00
# 针对策略驱动型银行代理的适应性欺诈压力测试 来源:https://arxiv.org/html/2608.18136 ###### 摘要 会话代理现在通过工具为最终用户执行操作,同时可以访问客户数据库和内部策略文档,呼叫者仅需通过对话即可触及这些资源。银行业是最清晰的案例:回答问题的同一代理也可以更改联系方式、重置PIN码或转账资金,因此普通的客户服务与授权、欺诈检测和策略合规密不可分。现有的金融欺诈基准测试对静态交易或消息进行分类,而通用代理安全基准测试则针对提示注入或通用有害用途;它们均未测试策略驱动型银行代理在呼叫者通过对话操纵身份、授权和信任时是否能安全地执行操作。我们推出了FraudBench,一个基于τ²-bench双重控制框架和τ-Knowledge银行环境构建的可执行基准测试。代理和模拟呼叫者都通过共享的、可变的账户状态进行工具操作,代理可以授予呼叫者对特定工具的访问权限;该环境暴露了一个包含698份文档的内部策略语料库,代理必须从中进行检索。FraudBench包含150个精心设计的对抗性场景;一个固定的公开集合包含107个任务(涵盖十种欺诈机制的90个任务,加上17个链式自适应攻击),用于所有报告的运行,另有43个链式攻击任务作为保留项。安全性是历史依赖的:单控制任务满足除一个前提外的所有前提,而自适应攻击使得后来的、局部有效的请求由于之前的探测、准入或失败尝试而变得不安全。每个场景都标注了可观察的证据、禁止的操作、安全处置和干预点。对四个代理在107个分级任务上的初步单次试验评估显示,攻击安全性在49%到65%之间,其中钱骡和第一方欺诈是最常见的跨模型弱点。 代码与数据——https://github.com/leanmcp/fraudbench ## 1引言 请参阅图注图1:FraudBench概览。一个模拟的自适应呼叫者在十种欺诈机制以及链式多步攻击中,针对一个策略驱动型银行代理发起攻击,攻击涉及特权工具、可变客户数据库和包含698份文档的内部策略语料库;根据完整的对话历史,对行动、状态、泄露和处置进行评分。之前的会话欺诈基准测试(如Fraud-R1)评估的是对欺诈*消息*的抵抗能力,不涉及工具、数据库或内部策略语料库,并且覆盖的银行业欺诈类型范围更窄。面向客户的会话代理只有在被赋予真实访问权限的情况下才有用:特权工具、生产环境的客户数据库以及机构的内部文档和操作规则。没有这种访问权限,代理无法完成任何非平凡的工作流程;有了这种权限,代理就成了一个暴露面,一个攻击平面,终端用户(通常是实际未经验证的呼叫者)可以通过对话本身触及内部数据和内部结构。受后台系统保护的个人详细信息可能被一个乐于助人的代理回应所泄露,代理本身必须逐个请求地决定,哪些它可见的数据可以被释放给与之交谈的人。银行业使利害关系变得具体。回答银行问题的代理与能够更改电子邮件、重置PIN码、解冻卡片、提出争议或转账资金的代理,其故障后果是不同的。在后一种情况下,普通的客户服务技能与授权、欺诈检测、隐私和策略合规密不可分。代理必须从不完整的对话中推断意图,从庞大的内部语料库中检索正确的规则,检查账户状态,决定是行动还是上报,并记住对话早期积累的证据。即使最终的自然语言回应听起来谨慎,一次不安全的工具调用也可能造成经济损失。一系列不断增长的基准测试,包括τ-bench、τ²-bench、银行领域的τ-Knowledge和ToolSandbox,已经表明此类使用工具的代理可以执行真实的客户工作流程(Yao等人2024;Barres等人2025;Shi等人2026;Lu等人2024);我们的问题是:当客户是对手时会发生什么。 周围的欺诈环境庞大且具有自适应性:美国联邦调查局(FBI)和美国联邦贸易委员会(FTC)报告2025年欺诈损失约为160-180亿美元,其中大部分是网络化的(联邦调查局互联网犯罪投诉中心2026;美国联邦贸易委员会2026)。这些损失并非由AI代理引起,但它们表明了高能力客户服务系统如今所部署的环境的规模。 现有评估存在空白。诸如PaySim、合成反洗钱(AML)数据和Elliptic之类的数据集支持欺诈标签或图分类研究,而非面向客户的行动(Lopez-Rojas、Elmir和Axelsson2016;Altman等人2023;Weber等人2019)。Fraud-R1引入了多轮欺诈和网络钓鱼诱导,但评估的是对话抵抗能力,没有银行数据库、特权银行工具或数百份运营策略文档(Yang等人2025)。通用代理安全套件测试提示注入、有害请求和不安全的网络或工具行为,但无法隔离银行业务的工作流程控制和欺诈类型。此外,这些环境几乎都没有赋予代理部署的客户服务代理实际拥有的东西:对生产级数据库的特权工具访问权,加上大量的内部非公开文档语料库;τ-Knowledge是唯一一个将工具使用与此类语料库相结合的相邻基准测试,但它衡量的是代理能否服务合法客户,而非能否抵御欺诈客户(Shi等人2026)。先前的欺诈基准测试检测可疑记录或抵抗诈骗对话,先前的代理安全基准测试测试通用有害用途或提示注入;它们均未评估策略驱动型银行代理在战略呼叫者随着时间操纵身份、授权和信任时是否能*安全地执行操作*。 我们推出FraudBench,一个在对抗性对话下评估策略驱动型银行代理的可执行基准测试(图1)。它扩展了τ-bench的交互范式(Yao等人2024)、τ²-bench的双重控制框架(Barres等人2025),以及τ-Knowledge的非结构化银行政策环境(Shi等人2026)。FraudBench不仅询问代理是否完成用户目标,还询问它是否防止不安全目标、识别相关控制、在危险行动前干预,并且仍然服务于匹配的合法客户。我们的贡献是: 1. 1. FraudBench,一个可执行的银行欺诈基准测试,其中防御代理验证身份、从包含698份文档的策略语料库中检索信息,并通过17个特权工具在可变的账户状态上执行操作,安全性取决于完整的对话历史而非最新消息; 2. 2. 一个包含150个手工设计的对抗性任务的数据集(一个固定的107任务公开集合:涵盖十种欺诈机制的90个任务,包括十个单决定性控制边界案例和十个自适应两阶段攻击,加上17个链式信任污染攻击,另有43个链式攻击作为保留项),每个任务由一个依赖历史的评判者评分,并标注了可观察的证据、禁止的操作、安全处置和干预点; 3. 3. 对协作式工具-代理-用户设置的对抗性扩展,其中呼叫者的私有目标与策略冲突,正确的结果可能是拒绝、上报或维持现状而非完成任务;以及 4. 4. 一个针对107个任务的多模型评估,其中四个代理的攻击安全性在49%到65%之间,钱骡和自适应链式攻击最难,表明该套件具有区分度且未饱和。 ## 2相关工作 ### 2.1金融欺诈基准测试 大多数公开的金融欺诈资源提供的是带标签的记录,而非交互式决策过程:PaySim模拟移动资金交易(Lopez-Rojas、Elmir和Axelsson2016),AMLSim和IBM合成AML数据集生成洗钱网络(Suzumura和Kanezashi2021;Altman等人2023),Elliptic提供了一个包含超过20万笔比特币交易的时间图,用于非法节点分类(Weber等人2019)。这些对检测模型很有价值,但不测试语言代理是否安全执行客户服务操作;DetoxBench同样对LLM垃圾邮件和滥用行为进行评分(Chakraborty等人2024)。Fraud-R1更接近我们的威胁模型,评估了对多轮欺诈和网络钓鱼诱导的抵抗能力(Yang等人2025),但其评估单元是由LLM评判者评分的欺诈*消息*,对话背后没有银行数据库、特权工具、账户状态或策略语料库,并且它覆盖的银行业欺诈类型范围更窄(诱导和网络钓鱼,而非钱骡、第一方争议、合成身份开通、卡控制滥用或代理中介的数据泄露)。FraudBench增加了可执行的银行状态、特权工具、长篇策略文档、行动级后果以及跨十种机制的工作流程特定控制。AuditFraudBench则针对公司文件中的欺诈性错误陈述(Liu等人2026)。 ### 2.2交互式工具-代理-用户评估 τ-bench评估在领域策略下模拟用户与使用工具的代理之间的动态对话,对最终数据库状态进行评分,并引入了pass^k来衡量重复可靠性(Yao等人2024)。τ²-bench扩展了这个设置,使得代理和用户都可以通过工具在共享环境中行动,并分析了推理失败与协调失败(Barres等人2025)。τ-Knowledge在银行领域将策略检索和工具使用结合起来,拥有大约700份文档,即使是强大的推理模型也难以实现高综合成功率(Shi等人2026);据我们所知,这是唯一一个将特权工具、客户数据库和大型内部文档语料库同时赋予代理的先前基准测试,但其目标是易用性——完成合法客户请求,而非抵御欺诈。ToolSandbox同样测试了带有中间里程碑的有状态、会话式工具使用(Lu等人2024)。FraudBench利用这些能力来研究不同的目标:对抗性呼叫者寻求不安全的效果,成功可能需要拒绝、上报或维护欺诈控制,而非完成任务。 ### 2.3代理安全与自适应红队测试 InjecAgent和BIPIA测试工具集成代理中的间接提示注入(Zhan等人2024;Yi等人2023);AgentDojo在实用性的同时衡量安全性(Debenedetti等人2024);Agent Security Bench和ToolEmu形式化了攻击和高风险工具风险(Zhang等人2024a;Ruan等人2023);AgentHarm和Agent-SafetyBench涵盖了恶意多步请求和广泛的安全案例(Andriushchenko等人2024;Zhang等人2024b);SafeArena和ST-WebAgentBench则研究了网络滥用和企业策略合规性(Tur等人2025;Levy等人2024)。AgentHazard尤其相关,因为它测试了从一系列局部合理的步骤中产生的危害(Feng等人2026)。然而,这些套件都没有将代理置于具有特权工具和大型内部非公开文档语料库的生产级客户数据库上,因此它们排除了主导面向客户部署的数据暴露和策略边界失败。FraudBench将这种历史依赖性建立在有状态银行服务内的客户身份、授权、欺诈、争议、卡和支付策略中。其当前版本是一个固定的可执行套件;迭代的、模型在环的攻击生成(Kiela等人2021;Perez等人2022)是未来的扩展方向。表1在交互式欺诈防御的核心能力方面比较了FraudBench与相邻的基准测试和框架。 表1:与相邻代理基准测试和框架的运营比较。✓表示主要的已实现能力;⊚表示部分或更窄的能力;–表示不是主要特性。*多类欺诈*:测试多种不同的欺诈类型。*历史依赖*:安全性取决于早期的轮次,而不仅仅是最新请求。*长对话*:与(模拟)用户的扩展多轮交互。*类型*表示该工作是固定基准测试、可重用框架还是两者兼有;FraudBench是一个固定的银行欺诈基准测试,其环境和攻击机制可重用于新场景。在这些基准测试中,DoomArena是一个通用的安全测试框架,向宿主环境(如τ-bench、BrowserGym和OSWorld)注入可配置的攻击(Boisvert等人2025),但它没有提供欺诈分类、银行策略语料库或领域特定场景;FraudBench占据了互补的位置,提供了该框架将托管的场景和语料库。如表1所示,现有基准测试或框架都没有结合可执行状态、大型策略知识库、多类欺诈、历史依赖安全性和长对话;FraudBench提供了所有这些。 ## 3FraudBench基准测试 ### 3.1问题表述 一个回合包含一个防御代理A、一个模拟呼叫者U、一个内部策略语料库D,以及一个银行环境,其数据库在t轮的状态记为s_t(客户记录、账户、卡、交易、争议和验证日志)。共享的工具集 T = T_read ∪ T_write...
相似文章
FinPersona-Bench: 自主金融代理纵向心理测量稳定性基准
介绍了FinPersona-Bench,这是一个用于衡量自主金融代理如何随时间保持其指定行为指令的基准,揭示了任务显著性衰减(MSD),这种衰减随时间距离增加而加剧,并因模型和代理特征而异。
DFAH-Bench:金融决策中可观测智能体不稳定性的基准评测
介绍DFAH-Bench,一个用于衡量金融智能体决策中行为不稳定性的重放基准,发现仅凭结果一致性会遗漏显著的轨迹分歧。
ComponentBench: 诊断计算机使用代理中的组件级故障
ComponentBench 引入了一个基准和诊断管道,用于评估计算机使用代理在现代网页用户界面中的组件级交互,通过关注现实、短暂的交互来诊断跨模型的故障,从而填补当前评估方法的空白。
InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk
InfraBench is a benchmark suite for evaluating AI agents on realistic infrastructure management tasks across the full stack, lifecycle, and risk levels. Experiments show that even the strongest agent configurations achieve only 40-88% effective scores and struggle with consistency and safety.
AdvPlan-Bench:结构化规划生成智能体的对抗性评估
AdvPlan-Bench 是一个离线基准,用于对抗性评估结构化规划生成智能体,在 150 个合成场景中使用 BLUE-vs-RED 优势和诊断指标比较计划,以研究响应预算敏感性和多智能体批判。