ReguSim:评估LLM代理在金融合规中的规则遵循

arXiv cs.AI 论文

摘要

介绍ReguSim和ReguBench以评估LLM代理在金融合规中的规则依据,发现可见规则可以减少但不能完全消除违规行为,并且激励框架会影响行为。

arXiv:2608.19974v1 Announce Type: new 摘要:金融市场中的LLM代理可能引用规则,但仍然提交违反可执行约束或误读监控证据的订单。我们引入ReguSim,一个受控的金融合规环境,以及ReguBench,一个目标标记的监控基准,以分离四个构件:陈述推理、尝试行动、执行强制和监控证据。在使用DeepSeek V4 Pro和Gemini 3.5 Flash的交易者运行中,可见规则减少了但没有消除被拒绝的行为,并且激励或人格框架改变了行为。一项桥接研究表明,除非显示执行证据,否则交易者的理由可能误导独立监控器。在监控中,简单的结构化基线要么匹配要么超过仅提示的LLM。结果将金融合规评估定义为基于规则的行动和证据使用的审计,而不是单一的合规分数。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:13

# 评估金融合规领域中的大语言模型智能体规则锚定
来源:https://arxiv.org/html/2608.19974

## ReguSim:评估金融合规领域中的大语言模型智能体规则锚定

###### 摘要
金融市场中的大语言模型智能体可能引用规则,但仍会提交违反可执行约束或误读监控证据的订单。我们引入了 ReguSim(一个受控的金融合规环境)和 ReguBench(一个带有目标标注的监控基准),用以区分四种产物:陈述性推理、尝试性动作、执行强制和监控证据。在使用 DeepSeek V4 Pro 和 Gemini 3.5 Flash 进行的交易者运行中,可见规则减少了但并未消除被拒绝的动作,并且激励或角色设定会改变行为。一项桥接研究表明,除非展示执行证据,否则交易者的理由可能误导独立的监控者。在监控方面,简单的结构化基准模型要么匹配,要么超越仅使用提示词的大语言模型。研究结果将金融合规评估定义为对规则锚定动作和证据使用的审计,而非单一的合规分数。

††脚注文本:
*同等贡献。
††脚注文本:
†通讯作者。

## 1 引言
大语言模型作为金融决策系统(包括交易代理和监控助手)的组成部分,正日益受到研究。在此类场景中,合规性不仅仅是一项文本处理技能。一个有用的金融代理必须知道规则何时适用、将规则转化为订单决策、通过确定性的执行检查,并基于记录证据支持监控判断。这引出了我们的核心问题:金融合规领域的大语言模型智能体何时遵循规则?何时尽管生成了看似合规的语言,但其激励、角色、体制或证据条件却导致它们忽略或滥用规则?
回答这个问题需要的不仅仅是一个单一的合规分数。模型可能提及相关规则,但仍尝试提交被价格区间暂停、卖空限制、T+1 回转约束或运营偿付检查所阻止的订单。价格限制和 T+1 回转约束是中国 A 股交易规则的标准特征,而卖空限制则出现在美国和香港市场框架中 [26](https://arxiv.org/html/2608.19974#bib.bib31); [12](https://arxiv.org/html/2608.19974#bib.bib32); [30](https://arxiv.org/html/2608.19974#bib.bib33); [11](https://arxiv.org/html/2608.19974#bib.bib34)。反之,快速的来回交易或方向反转可能值得审查,但在没有所有权、意图、订单生命周期、欺骗或价格影响证据的情况下,不足以得出法律结论 [31](https://arxiv.org/html/2608.19974#bib.bib35); [29](https://arxiv.org/html/2608.19974#bib.bib36); [4](https://arxiv.org/html/2608.19974#bib.bib37); [22](https://arxiv.org/html/2608.19974#bib.bib38); [10](https://arxiv.org/html/2608.19974#bib.bib39)。
因此,我们区分四种产物:模型陈述的推理、其尝试的动作、执行层接受/拒绝的决定,以及监控者可用的证据。我们引入了 ReguSim(一个用于研究可执行金融规则下大语言模型智能体合规行为的受控环境)和 ReguBench(一个基于程序生成的、用于基于证据的监管监控基准)。ReguSim 将交易者动作路由到风格化的市场体制中,并将执行结果与陈述的推理分开记录;ReguBench 提供带有确定性生成器标签的目标标注操纵记录。
利用这些产物,我们发现激励和角色设定改变了被拒绝的交易者尝试,陈述的规则意识不能保证可执行的合规性,并且这种动作差距并非某个交易者模型所独有:一个匹配的 Gemini 复制运行总体上比主要的 DeepSeek 运行更为谨慎,但在强规则压力下仍会产生被硬性阻止的尝试。一项桥接研究进一步表明,除非执行证据可用,否则独立的监控者可能被交易者自信但错误的合规理由所误导。在监控方面,大语言模型在当前合成样本上并未明显超越简单的结构化基准模型。这些结果展示了为什么金融代理基准不应将监管文本、尝试的动作、执行控制和监控证据压缩为一个合规标签。
总之,我们的贡献在于:
- •基准和接口:ReguBench 提供了一个固定的、目标标注的监控基准。同时,交易者、监控者和桥接任务评估了同一合规流程的互补组件。
- •评估框架:ReguSim 在单个金融合规循环内隔离了四种不同类型的信息:代理陈述的推理、尝试的订单、执行结果以及呈现给监控者的证据。
- •合规行为发现:我们表明,可见的规则和看似合理的理由并不能保证锚定的动作或基于证据的判断:激励和角色设定改变了被拒绝的尝试,仅靠提示词的控制无法替代执行检查,监控在很大程度上依赖于结构化证据。我们未基于当前的合成证据对真实世界的违规率或模型扩展性做出声明。

## 2 相关工作
金融大语言模型研究已产生了针对金融文本和知识密集型任务的领域模型,包括 FinGPT 和 BloombergGPT [17](https://arxiv.org/html/2608.19974#bib.bib1); [36](https://arxiv.org/html/2608.19974#bib.bib3)。交易框架将这一方向扩展到投资组合支持、强化学习和专家风格决策 [18](https://arxiv.org/html/2608.19974#bib.bib2); [6](https://arxiv.org/html/2608.19974#bib.bib4); [5](https://arxiv.org/html/2608.19974#bib.bib5)。更新的一系列研究将大语言模型视为市场参与者,在交易前进行辩论、专业化分工或对事件做出反应 [37](https://arxiv.org/html/2608.19974#bib.bib6); [39](https://arxiv.org/html/2608.19974#bib.bib7); [19](https://arxiv.org/html/2608.19974#bib.bib9)。其他模拟器研究了市场规律性、合成交易所交互或行为一致性 [8](https://arxiv.org/html/2608.19974#bib.bib10); [25](https://arxiv.org/html/2608.19974#bib.bib8); [38](https://arxiv.org/html/2608.19974#bib.bib12); [16](https://arxiv.org/html/2608.19974#bib.bib11)。这些研究使大语言模型在金融中的代理能力具体化,但其主要证据通常是盈利能力、价格动态、策略遵循或市场现实性。我们关注的是相邻的问题:金融动作中的规则锚定。
在合规场景中,模型不仅需要复述规则;它必须在采取行动之前,将规则与当前价格、头寸、现金和订单生命周期绑定。关于使用工具和可回放代理的研究认为,需要外部行动的大语言模型需要过程痕迹而非最终答案 [13](https://arxiv.org/html/2608.19974#bib.bib21),基准审计研究同样警告,对于检索证据、调用工具、更新状态或进行外部行动的系统,最终答案的准确性是不够的 [34](https://arxiv.org/html/2608.19974#bib.bib23); [32](https://arxiv.org/html/2608.19974#bib.bib24)。ReguSim 将这一思想专门应用于金融合规,将陈述的理由、尝试的订单、确定性的执行结果和账本状态作为独立的记录保留。
金融监控研究提供了监控侧的对应部分。市场操纵检测长期以来有针对特定任务的统计和机器学习模型。拉高出货研究使用论坛、交易图或时空图特征来识别协调的价格和成交量模式 [21](https://arxiv.org/html/2608.19974#bib.bib13); [35](https://arxiv.org/html/2608.19974#bib.bib14); [20](https://arxiv.org/html/2608.19974#bib.bib15)。幌骗研究则关注订单簿动态、撤销以及基于限价订单簿状态的序列模型 [28](https://arxiv.org/html/2608.19974#bib.bib16); [33](https://arxiv.org/html/2608.19974#bib.bib17)。对抗性和多智能体模型进一步将操纵和检测视为战略性行为 [27](https://arxiv.org/html/2608.19974#bib.bib18)。当需要解释、检索或跨模式推理时,大语言模型监控器具有吸引力 [23](https://arxiv.org/html/2608.19974#bib.bib19); [3](https://arxiv.org/html/2608.19974#bib.bib25),但这些系统应在相同的目标标注样本上与透明的、基于特征的基准模型进行比较。这推动了 ReguBench 的目标标注记录和配对基准比较。
法律和监管大语言模型基准评估以法规、合同或文档为中心的推理。LegalBench 和 LexEval 针对跨任务和司法管辖区的法律推理 [7](https://arxiv.org/html/2608.19974#bib.bib26); [14](https://arxiv.org/html/2608.19974#bib.bib27),而 LexGLUE 和 CUAD 则强调文档分类和合同审查 [2](https://arxiv.org/html/2608.19974#bib.bib30); [9](https://arxiv.org/html/2608.19974#bib.bib29)。面向检索的法律基准测试在法律文档集合中的锚定能力 [15](https://arxiv.org/html/2608.19974#bib.bib28)。金融模型风险指南强调受监管环境中的文档化、验证和持续监控 [1](https://arxiv.org/html/2608.19974#bib.bib20),而大语言模型代理审计跟踪研究则研究问责记录 [24](https://arxiv.org/html/2608.19974#bib.bib22)。这些方向确立了法律推理、监控和可审计性作为重要目标。剩余的空白是金融合规代理的评估环境,该环境将规则文本、尝试的动作、可执行控制和监控证据分开,而不是将它们压缩为单一的合规分数。ReguSim 和 ReguBench 填补了这一空白。

## 3 方法论
ReguSim 和 ReguBench 旨在使监管行为在语言与市场动作的边界上可观测。ReguSim 提供可执行的交易环境;ReguBench 提供监控侧对应部分,具有程序生成的记录、标注目标和确定性的监控标签。这两个产物基于一个共同的设计原则:为陈述的推理、尝试的动作、执行结果和监控证据维护独立的记录。
参见标题图 1:ReguSim 和 ReguBench 流程。ReguSim 记录提示状态、交易者理由/动作、执行结果和跟踪证据;ReguBench 根据该证据评估目标标注的监控者判断。

### 3.1 ReguSim 交易环境
ReguSim 的交易者循环刻意设计得简单:它将模型的单个文本决策转化为可审计的市场动作。一个提供者封装为大语言模型调用提供与模型无关的接口;提示描述当前市场状态、投资组合状态、监管体制和代理角色设定;响应解析器提取一个动作(买入、卖出、卖空、平仓或持有),并在适用时包含订单参数;执行引擎在更改账本之前应用机器可检查的规则。存储的跟踪包括提示、原始响应、解析的动作、交易前和交易后状态、接受或拒绝的状态以及拒绝证据。
在主要的交易者协议中,提示在每个决策步骤包含当前体制的自然语言规则文本,以及当前价格、前收盘价、现金、股票和多头/空头头寸摘要。执行引擎还维护硬控制所需权威账本状态,例如同场购买数量和偿付能力风险敞口。因此,违规不应被简单解读为监管知识缺失:有些是可见规则和价格下的规则-动作锚定失败,而另一些则暴露了对超越紧凑提示摘要的可执行状态的需求。

**输入:** 体制 r,市场状态 mt,投资组合 pt,目标/角色文本
**输出:** 带有语言、尝试动作、执行结果和证据的可审计跟踪
构建基于 (r, mt, pt) 的交易者提示
调用大语言模型并存储原始响应
解析一个动作、数量、理由、风险和合规声明
如果该动作违反硬约束,则拒绝该订单并存储拒绝代码,保持投资组合和市场账本不变;否则执行订单并更新现金、持仓和风险敞口
计算可能可疑但非结论性法律发现的审查标志
返回完整的跟踪记录,供后续交易者或监控者分析

算法 1 ReguSim 交易者循环记录构建。算法 1 ([链接](https://arxiv.org/html/2608.19974#algorithm1)) 指定了单个决策步骤的输入输出合约。例如,交易者可能收到一个中国 A 股状态,声称知晓当日回转规则,但仍然提交一个卖出同日早前购入股票的订单。引擎记录两部分信息:陈述的理由可供分析,而尝试的订单则被拒绝并附上机器可检查的代码。

### 3.2 监管体制与合规信号
我们评估在三种市场启发的监管设置和两种合成控制设置下的交易行为。市场启发的设置基于美国、中国 A 股和香港交易环境的共同特征。它们编码了一小套公开规则驱动的约束:适用时的价格区间、卖空可用性、同场回转限制、现金和持仓检查以及运营总风险敞口限制。合成控制设定了规则空间的边界:LAX 放松了大部分限制,而 STRICT 则结合了更严格的价格、回转、卖空和头寸控制。这种设计使我们能够使用相同的执行引擎,在弱、市场启发和故意强规则压力下比较代理行为。
表 1:执行层使用的监管和合成控制设置。美国、中国 A 股和香港是市场启发的设置;LAX 和 STRICT 提供较弱和较强规则压力的控制。总风险敞口上限是交易所偿付控制,而非法定操纵规则。
表 1 ([链接](https://arxiv.org/html/2608.19974#S3.T1)) 定义了执行层可以直接检查的内容。其范围是模拟器使用的可执行规则表面,而非每个市场的完整法律或交易所规则手册。然后,我们使用如图 1 ([链接](https://arxiv.org/html/2608.19974#S3.F1)) 所示的三部分证据词汇,将执行、审查和监控声明区分开来。这种区分很重要,因为审查标志和监控标签并非法律结论:法律结论需要模拟器未表示的证据,例如实际受益所有权、意图、订单生命周期、对手方身份、推广或价格影响。这个边界也定义了我们的测量不声称的内容。硬阻止是模拟器对尝试订单的拒绝,而非经裁决的市场违法行为。审查标志是用于检查的操作提示,而非不当行为认定。监控标签是基准生成器的目标级别标签,而非法院、监管机构或专家的决定。我们使用这些产物来评估大语言模型是否能在受控环境中将规则文本、状态、动作和证据绑定;我们不估计真实世界的不当行为普遍性或法律责任。

表 2:ReguBench 按监控类别组成的构成。源代码区分合成、案例启发、参数变体和规模变体模板;所有记录均为合成。

### 3.3 ReguBench 监控基准
ReguBench 评估了相同设计的监控侧。它包含 191 个场景和 49,440 条记录,涵盖对倒交易、幌骗、拉高出货、刷单和收盘价操纵。每个场景由一个操作模板生成,该模板指定了预期模式、目标记录、干扰记录、难度级别和...

相似文章

LLM治理的机械执行:金融决策系统中治理-任务解耦的证据

arXiv cs.CL

本文引入了五项治理指标,用于在受监管金融工作流程中量化LLM在决策理由层面的政策合规性。研究发现,机械执行(在模型解释循环之外操作)将无信息的延迟决策减少了73%,并揭示了治理-任务解耦:纯文本治理在压力下两个维度均退化,而机械执行即使在任务性能下降时仍能保持治理质量。