ViperQ:基于拍卖市场理论的订单流模式识别在强化学习交易中的应用

arXiv cs.AI 论文

摘要

ViperQ 是一个强化学习交易系统,它使用拍卖市场理论原语进行状态表示,在诸如 TSLA 和 NVDA 等股票的金融 Tick 数据回测中展示了高投资回报率(ROI)。

arXiv:2609.13825v1 公告类型:新 摘要:学术文献中发表的强化学习交易系统绝大多数依赖价格聚合状态表示(OHLCV 柱状图)或限价订单簿深度特征,使得实践者文献中的微观结构模式理论,即 Auction Market Theory 和 Market Profile,缺乏经过同行评审的计算实例化。我们提出 ViperQ,一个强化学习系统,其状态表示明确基于 Auction Market Theory 原语构建:Volume Point of Control、Value Area 位置、Low Volume Node 标志、Cumulative Volume Delta 偏差和 tape-velocity 签名,组合成一个 20 维的 Z 标准化向量。两个 Proximal Policy Optimisation 代理使用基于前景理论的非对称奖励函数进行训练,该函数惩罚亏损持仓,其幅度与 Kahneman and Tversky 的损失厌恶系数一致。在代理从未见过的机构 Tick 数据保留的十二个月分区上进行评估,ViperQ 在零杠杆下实现了 TSLA +163.6% 的 ROI(-27.5% 最大回撤,27,019 笔交易)和 NVDA +116.5% 的 ROI(-47.8% 最大回撤,12,892 笔交易)。这些结果确立了 Auction Market Theory 特征作为金融时间序列上顺序决策的一种可处理的结构化输入模态,并推动了对微观结构感知策略学习的进一步工作。
查看原文
查看缓存全文

缓存时间: 2026/09/15 09:03

# 基于拍卖市场理论的订单流模式识别在强化学习交易中的应用
来源:https://arxiv.org/html/2609.13825
期刊:arXiv  
作者:  
Asser Moustafa  
邮箱:[[email protected]](mailto:[email protected])  
通讯作者  
地址:科罗拉多大学科罗拉多斯普林斯分校计算机科学系,1420 Austin Bluffs Pkwy, Colorado Springs, CO 80918, 美国  

Rares-Mihail Neagu  
邮箱:[[email protected]](mailto:[email protected])  
地址:爱荷华大学计算机科学系,101 Jessup Hall, Iowa City, IA 52242, 美国  

Jugal Kalita  
邮箱:[[email protected]](mailto:[email protected])  
地址:科罗拉多大学科罗拉多斯普林斯分校计算机科学系,1420 Austin Bluffs Pkwy, Colorado Springs, CO 80918, 美国

###### 摘要

学术文献中发表的强化学习交易系统绝大多数依赖于价格聚合状态表示(OHLCV K线)或限价订单簿深度特征,使得来自实践者文献的微观结构模式理论——即拍卖市场理论和市场轮廓理论——缺乏经过同行评审的计算实现。我们提出了ViperQ,一个强化学习系统,其状态表示明确基于拍卖市场理论的基本要素构建:成交量控制点(Volume Point of Control)、价值区(Value Area)位置、低量节点(Low Volume Node)标志、累积成交量差(Cumulative Volume Delta)背离以及盘口速度(tape-velocity)特征,这些要素被整合成一个20维的Z分数标准化向量。两个近端策略优化(PPO)智能体使用基于前景理论的不对称奖励函数进行训练,该函数对持仓亏损的惩罚幅度与卡尼曼和特沃斯基的损失厌恶系数一致。在机构级逐笔交易数据的保留十二个月测试分区(智能体从未见过)上评估,ViperQ在TSLA上实现了+163.6%的ROI(最大回撤-27.5%,交易27,019次),在NVDA上实现了+116.5%的ROI(最大回撤-47.8%,交易12,892次),且杠杆为零。这些结果确立了拍卖市场理论特征作为金融时间序列上序贯决策的一种可行结构化输入模态,并为后续的微观结构感知策略学习研究提供了动力。

###### 关键词:

强化学习、模式识别、时间序列分类、序贯决策、订单流、市场微观结构

## 1 引言

深度强化学习(RL)在金融决策中的应用在过去五年中迅速扩展[11, 20],已有的系统涵盖了投资组合再平衡[29, 17]、最优交易执行[15, 10, 7]、做市[27, 32]以及方向性高频交易[1, 31]。纵观这些工作,状态表示的选择惊人地同质化。系统要么使用价格聚合特征(开盘-最高-最低-收盘柱、收益率、波动率、技术指标),要么在更高分辨率下使用原始限价订单簿(LOB)深度快照[30, 28]。另一条并行的传统则通过*市场微观结构理论*的视角来解读同样的数据:价格发现是知情与不知情订单流之间策略性互动的结果[14],做市商更新报价以反映传入订单的信息内容[8],由此产生的微观结构动态决定了价格何时以及如何在均衡之间转换[19, 6]。在这种微观结构框架内,Steidlmayer的市场轮廓理论[22]和Dalton的拍卖市场理论[5](AMT)将两种可重复的微观结构机制操作化,这些机制在专有交易实践中被广泛采用:*平衡*状态(围绕公允价值的均值回归共识)和*失衡*状态(单侧流动性真空驱动价格发现转向新的均衡)。尽管经过了三十五年的实践者采用,但据对arXiv、Semantic Scholar、IEEE Xplore、ACM Digital Library和ScienceDirect的详尽检索所确定,这种微观结构模式理论至今尚未作为状态表示被实例化用于经过同行评审的强化学习交易智能体。

本文填补了这一空白。我们提出了ViperQ,据我们所知,这是第一个经过同行评审的强化学习交易系统,其状态表示明确构建于Steidlmayer-Dalton拍卖市场理论的基本要素之上。该状态表示将成交量控制点(VPOC)、价值区边界、低量节点标志、累积成交量差背离、盘口速度以及订单流失衡编码为一个20维的Z分数标准化向量,直接供一个近端策略优化[21]智能体使用,该智能体以1秒的分辨率在机构逐笔数据上运行。

问题的构建方式是有意地采用模式识别框架,而非金融工程框架。等效于分类器的任务是从微观结构观测流中进行*平衡与失衡*状态的二元识别,而序贯策略学习则依赖于该识别。因此,我们认为对模式识别社区具有最广泛意义的贡献是该结构化状态表示本身:它证明了一套实践者的模式理论,通过明确编码而非端到端学习的方式,能够产生一个状态空间,在这个空间上一个小型神经网络策略可以收敛到显著的样本外利润。从这个角度看,交易领域的应用是方法论要点的下游应用。

我们总结我们的贡献如下:

1.  **拍卖市场理论状态表示**。我们定义并实现了一个20维状态向量$s_t \in \mathbb{R}^{20}$,其物理推导的组成部分(VPOC、价值区位置、低量节点标志、CVD背离、盘口速度、订单流失衡)是Steidlmayer[22]和Dalton等人[5]首次形式化的概念的直接计算模拟物。据我们所知,此前没有任何经过同行评审的RL交易智能体将这一特征族用作状态输入。
2.  **基于前景理论的奖励塑造**。Sniper奖励函数应用了与卡尼曼和特沃斯基的损失厌恶系数[13, 26]一致的不对称痛苦惩罚,并增加了合成的训练内交易费用通胀,迫使智能体转向高确信度的设置,而非微小剥头皮。
3.  **资产特异性行为差异**。我们展示,单一架构通过两种奖励函数配置训练,收敛到两个不同的盈利策略(一个用于TSLA的高频剥头皮策略和一个用于NVDA的趋势跟踪风险厌恶策略),这表明资产特异性的奖励塑造从相同的基础状态表示产生了不同且各自盈利的局部最优解。
4.  **样本外实证验证**。在一个严格保留的12个月测试分区上,ViperQ在零杠杆和监管费用核算下,在TSLA上产生了+163.6%的ROI,在NVDA上产生了+116.5%的ROI。这些数字高于Pippas等人[20]综述的典型范围,但代价是比保守的投资组合再平衡系统有更实质性的回撤(第6节)。

本文其余部分组织如下。第2节将ViperQ置于深度学习LOB和RL交易文献的背景下。第3节形式化了状态表示、奖励函数和双PPO训练策略。第4节描述了风险约束执行层。第5节详述了实验方案;第6节呈现结果并与先前系统进行比较。第7节阐述了本工作的局限性,第8节是结论。

## 2 相关工作

**基于限价订单簿的深度学习**。DeepLOB架构[30]确立了卷积网络作为从原始LOB快照进行中间价预测的标准基线,并被扩展到Transformer架构(LiT[28])和多资产注意力模型。这些系统将订单簿视为一个结构化但未标注的时间序列,并端到端地学习特征;它们不编码先验的微观结构理论,并且通常作为分类器而非控制智能体运行。

**用于交易和执行的强化学习**。第二条线是将RL直接应用于交易或执行决策。Zhang等人[31]在50份期货合约上以日频分辨率比较了DQN、策略梯度和A2C智能体。Théate和Ernst[23]为日频股票交易引入了TDQN。Yang等人[29]在道琼斯30指数上展示了PPO、A2C和DDPG的集成,使用日度再平衡。Liu等人[17]发布了FinRL库,这标准化了后续的大量文献。在更高频率上,Briola等人[1]在Intel LOB事件上训练了PPO;Lin和Beling[15]在Level-2数据上生产了一个端到端的PPO执行智能体;Hafsi和Vittori[10]以及Espana等人[7]将这条线延续到队列反应式模拟环境中。Coletta等人[3]提供了LOB环境的条件生成器;Wang等人[27, 18, 32]解决了RL做市问题。两篇同期的综述[11, 20]对该领域进行了编目;Pippas等人批判性地评估了167篇论文,并指出微观结构特征的整合是一个方法论空白。

**微观结构特征工作**。Jaddu和Bilokon[12]将订单簿的深度学习表示与使用订单流失衡特征[4]的RL结合起来。据我们所知,这是在精神上最接近ViperQ的先前工作,但其特征族是OFI而非拍卖市场理论;我们使用的构念(VPOC、价值区、LVN、平衡/失衡分类)未出现在任何已审查的系统中。

**拍卖市场理论**。我们所依据的理论传统起源于Steidlmayer的市场轮廓理论[22]和Dalton的拍卖市场理论[5],它们将日内价格发现框架化为在平衡(均值回归的双向交易)和失衡(单侧流动性真空)状态之间的振荡。这些构念在专有交易实践中被广泛采用超过三十年,但对主要学术索引的专注文献检索未发现任何使用它们作为显式状态特征的经过同行评审的强化学习系统。ViperQ填补了这一空白。

**模式识别先例**。应用驱动的强化学习在本期刊已有先例。Liu等人[16]将层次RL应用于芯片宏布局;Tsantekidis等人[25]在一个相关的Elsevier会议上将知识蒸馏深度RL应用于金融交易。这些工作确立了当框架化为模式识别方法时,领域应用RL贡献是在范围内的。

## 3 方法

我们将序贯交易视为一个马尔可夫决策过程($\mathcal{S}, \mathcal{A}, P, R, \gamma$),实现为一个自定义的Gymnasium[24]环境^1,所有执行都以下一根K线的开盘价定价,以消除前瞻偏差。

^1 Gymnasium: https://gymnasium.farama.org/

### 3.1 订单流模式:撮合引擎与拍卖市场理论

状态表示基于市场微观结构理论的两个组合模式。图1形式化了撮合引擎:一个连续的双向拍卖[14, 9],其中激进的市价订单消耗被动的挂单流动性,中间价位移$\Delta P$仅在接触价位的挂单数量耗尽时发生[4]。ViperQ通过下面定义的累积成交量差、盘口速度和订单流失衡特征直接衡量激进性和被动深度,因此能在$\Delta P$在价格中显现*之前*观察到消耗速率。

图1:撮合引擎:激进的市场流动消耗被动的挂单流动性;价格仅在接触价位的挂单量被完全消耗时移动。ViperQ通过CVD斜率、盘口速度和失衡比率(第3.2节)来观察消耗速率。

图2描绘了拍卖市场理论的第二个模式:日内价格发现在平衡机制(在价值区内进行均值回归交易;被动策略最优:保持空仓)和失衡机制(单侧激进造成流动性真空,价格冲刺寻找新的价值区)之间振荡[22, 5]。智能体的目标是检测到转换状态。

图2:拍卖市场理论:市场在平衡和失衡之间振荡。智能体的目标是从价值区A到价值区B的转换,在平衡阶段保持空仓,并在突破时持仓。

### 3.2 状态表示

每个观测$s_t \in \mathbb{R}^{20}$是一个Z分数标准化的向量,分为三个区块(表1)。区块A编码AMT/微观结构模式;区块B在运行时注入两个动态的仓位感知变量;区块C提供九个滞后对数收益率,以提供9秒的记忆而无需循环。

表1:20维状态向量$s_t$的组成

相似文章

QuantAgent:基于价格驱动的多智能体大语言模型高频交易框架

Papers with Code Trending

QuantAgent 是一个专为高频交易设计的多智能体大语言模型框架,通过四个专业智能体(指标、形态、趋势、风险)基于短周期信号快速做出具有风险意识的交易决策。在对比比特币和纳斯达克期货在内的十种金融工具的零样本评估中,该框架在预测准确率和累计收益方面均优于现有的神经网络和规则驱动基线模型。

Reversal Q-Learning

arXiv cs.LG

本文提出了Reversal Q-Learning(RQL),一种离线强化学习算法,它利用扩展马尔可夫决策过程框架和技术训练流策略,无需随时间反向传播即可实现离策略强化学习。该算法在具有挑战性的模拟机器人任务上达到了最先进的性能。