AQuA:递归自我改进的量化交易研究智能体

arXiv cs.CL 论文

摘要

AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。

arXiv:2608.12841v1 公告类型:新 摘要:我们研究量化投资研究层面的递归自我改进:即一个自主系统能否利用先前实验的证据来改进后续迭代中提出的假设和候选方案。我们提出了 AQuA,它由两个独立的语言模型驱动研究系统组成:一个用于符号因子发现,另一个用于可训练模型开发。这两个系统不共享智能体、记忆、候选空间或研究状态。相反,每个系统都通过保留经过验证的证据并用其指导后续提议,独立地闭合自己的研究循环。在这种受限的意义上,两个系统都在研究过程层面实现了递归自我改进。每个系统还使用自己的密封沙箱,该沙箱固定了数据划分、特征和标签定义以及评估器,同时允许模型仅通过受约束的因子表达式或配置差异进行操作。因子系统是一个由管理者中介的多智能体流水线,它发现因子并将因子组合成信号,在加密货币域上达到约 $0.190$ 的综合信息系数。模型系统是一个在混合时间序列架构上运行的配置驱动循环,在美国股票上达到个股信息系数 $+0.0843$,并将其转化为阈值多空策略,在双腿成本下样本外夏普比率高达 $+2.50$。该策略在 2021 年至 2025 年的每一年均为正收益。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:27

# 递归自改进的量化交易研究代理
Source: https://arxiv.org/html/2608.12841
Jiacheng Guo1\*, Suozhi Huang1\*, Yunlong Gao2\*, Zihao Li1, Jian Ge, Xu Kuang3, Mengdi Wang1 1Princeton University2Ant Group3Stanford University

###### 摘要

我们研究量化投资研究层面的递归自改进:一个自主系统能否利用早期实验获得的证据,改进后续迭代中提出的假设与候选方案。我们提出了AQuA,它包含两个由语言模型驱动的独立研究系统:一个用于符号因子发现,另一个用于可训练模型开发。这两个系统不共享智能体、记忆、候选空间或研究状态。相反,每个系统各自独立地通过保留经过验证的证据并利用这些证据指导后续提案,来闭合自己的研究回路。在这个有界意义上,两个系统都在研究过程层面实现了递归自改进。每个系统还使用自己的封闭沙箱,固定数据划分、特征与标签定义以及评估器,同时仅允许模型通过受限的因子表达式或配置差异进行操作。因子系统是一个由管理者协调的多智能体流水线,在加密资产宇宙上发现并组合因子,最终达到约0.190的组合信息系数。模型系统是一个配置驱动的循环,运行在混合时间序列架构上,在美股上达到每股+0.0843的信息系数,并在双边成本下将其转化为阈值多空策略,留出集夏普比率高达+2.50。该策略在2021年至2025年期间每年均为正收益。

## 1 引言

量化投资研究在大规模因子与模型空间中进行搜索,而微小的方法论错误可能转化为看似可信但不可复现的回测。一个读取未来信息的特征、一个基于测试集选出的策略,或一个仅在某个有利市场状态中成立的结果,都可能在样本外失效6 (https://arxiv.org/html/2608.12841#bib.bib8);5 (https://arxiv.org/html/2608.12841#bib.bib9)。因此,量化研究依赖于冻结的数据划分、留出评估以及对异常强劲结果的怀疑态度20 (https://arxiv.org/html/2608.12841#bib.bib23)。

大型语言模型现在能够提出假设、编写实验,并根据实证反馈修正其搜索过程。然而,现有的量化智能体通常只关注因子发现34 (https://arxiv.org/html/2608.12841#bib.bib28);11 (https://arxiv.org/html/2608.12841#bib.bib34)或模型开发23 (https://arxiv.org/html/2608.12841#bib.bib40);36 (https://arxiv.org/html/2608.12841#bib.bib42)。更重要的是,不受约束的智能体可能会破坏其后续迭代所依赖的证据。

一个会生成代码的智能体可能无意中引入时间对齐或预处理错误,从而使用预测时不可获得的信息。审查智能体可能因为代码在语义上看似合理而遗漏该错误。如果由此产生的数据泄漏带来了高分,该实验可能会被存储为成功先例,并在后续迭代中传播。因此,递归改进既可以放大真实的发现,也同樣容易放大未被察觉的错误。

提示层面的指令和基于模型的审查并不能提供可靠的完整性边界:反复访问固定留出集可能导致自适应过拟合9 (https://arxiv.org/html/2608.12841#bib.bib48),并且已有观察发现语言模型智能体会利用错误设定的目标、测试、评估器或奖励机制14 (https://arxiv.org/html/2608.12841#bib.bib49);7 (https://arxiv.org/html/2608.12841#bib.bib50);3 (https://arxiv.org/html/2608.12841#bib.bib51)。

AQuA则反其道而行,使智能体无法采取导致泄漏的行为。每个系统在自主迭代开始前就固定其数据流水线、划分、标签和评估器。智能体不能编写任意的实验代码;它只能以受限的领域特定语言(DSL)输出程序,而该语言不包含修改或绕过封闭数据路径或评估器的任何操作。

我们构建了AQuA,由两个独立的递归自改进研究系统组成:一个用于因子发现,一个用于模型开发。它们不共享智能体、记忆、候选空间或输出。在每个系统中,经过验证的实验会更新局部研究状态,进而指导后续提案,而用于评判这些提案的实验契约保持不变。因此,得到改进的是研究过程,而非成功的定义。

参见图注图 1:两个 AQuA 系统总览。因子发现(Part I)和模型开发(Part II)使用各自独立的智能体、记忆、搜索空间和输出。每个系统分别通过“假设—构建/训练—评估—验证—选择/组合—持久更新”来闭合自身回路,其中持久更新指导下一次迭代。关键设计在于不对称自由:智能体可以在其 DSL 内自由探索,但评估器位于自适应表面之外。Part I 通过一个由管理者协调的多智能体流水线实现该原则:提出可证伪的经济假设、评估因子、组合幸存信号,并在多次运行间携带经验信念。Part II 则通过一个配置驱动的循环运行在混合时间序列模型上;每个配置差异定义一个可比较的模型变体,其结果更新用于提出下一个变体的知识。

两个系统都产生样本外信号。在加密资产宇宙上,Part I 达到约0.190的组合信号信息系数。在美股上,Part II 达到每股+0.0843的信息系数,而在同一评估器下,最强基线 GRU 为+0.0613——绝对提升+0.0230,相对提升37.5%。由此得到的阈值多空策略在双边成本为2个基点的条件下达到+2.50的留出集夏普比率,并在2021至2025年间每年均为正收益。在更严格的滚动前推评估中,每个模型和策略参数仅使用下一个测试段之前的数据进行固定,夏普比率仍保持在约+2.0。

我们的主要贡献如下:

- •我们在量化研究的两个独立组成部分中实例化了递归自改进。在因子发现和模型开发中,经过验证的实验改进了后续研究决策,同时两个系统互不耦合。
- •我们构建了一个自主因子发现系统。一个由管理者协调的多智能体流水线提出、评估并组合因子,同时在多次运行间携带经验信念。
- •我们设计了一个混合时间序列模型和一个自主开发循环。一个配置驱动的智能体在封闭评估沙箱中训练可直接比较的变体。
- •我们展示了样本外预测与交易性能。两个系统在加密资产和美股份别产生正向信号,其中股票策略在完全因果的滚动前推评估下仍保持盈利。

第3节 (https://arxiv.org/html/2608.12841#S3)描述共享的高级模式以及两个封闭沙箱;第4节 (https://arxiv.org/html/2608.12841#S4)和第5节 (https://arxiv.org/html/2608.12841#S5)分别介绍因子发现和模型开发。

## 2 相关工作

#### 基于 LLM 的 alpha 因子挖掘。

一个快速发展的研究方向使用大型语言模型挖掘公式化 alpha 因子。它建立在基于算子的因子搜索之上,这类搜索使用遗传编程51 (https://arxiv.org/html/2608.12841#bib.bib5);13 (https://arxiv.org/html/2608.12841#bib.bib6)和强化学习48 (https://arxiv.org/html/2608.12841#bib.bib7);50 (https://arxiv.org/html/2608.12841#bib.bib21);53 (https://arxiv.org/html/2608.12841#bib.bib29);54 (https://arxiv.org/html/2608.12841#bib.bib33),并且现在扩展到了进化式与智能体搜索19 (https://arxiv.org/html/2608.12841#bib.bib2);38 (https://arxiv.org/html/2608.12841#bib.bib13);37 (https://arxiv.org/html/2608.12841#bib.bib30);44 (https://arxiv.org/html/2608.12841#bib.bib31);22 (https://arxiv.org/html/2608.12841#bib.bib52);46 (https://arxiv.org/html/2608.12841#bib.bib53);27 (https://arxiv.org/html/2608.12841#bib.bib54);49 (https://arxiv.org/html/2608.12841#bib.bib55)、程序级综合26 (https://arxiv.org/html/2608.12841#bib.bib15)、图结构进化17 (https://arxiv.org/html/2608.12841#bib.bib16)、带经验记忆的自进化智能体42 (https://arxiv.org/html/2608.12841#bib.bib17);47 (https://arxiv.org/html/2608.12841#bib.bib20)、受安全性与可复现性约束的生成33 (https://arxiv.org/html/2608.12841#bib.bib18)、市场逻辑建模43 (https://arxiv.org/html/2608.12841#bib.bib19)以及标准化基准30 (https://arxiv.org/html/2608.12841#bib.bib14)。新系统进一步加入了树搜索和思维链提示34 (https://arxiv.org/html/2608.12841#bib.bib28);10 (https://arxiv.org/html/2608.12841#bib.bib32)、多智能体生成-选择流水线11 (https://arxiv.org/html/2608.12841#bib.bib34);40 (https://arxiv.org/html/2608.12841#bib.bib47),以及公式化因子与文本新闻流的融合18 (https://arxiv.org/html/2608.12841#bib.bib35)。经典的公式化 alpha 词汇表24 (https://arxiv.org/html/2608.12841#bib.bib4)是所有这些工作的基础。我们的 Part I 属于这一研究方向,并共享其“先提案、记忆驱动”的设计。AQuA 将这个因子发现系统与另一个独立的自主模型开发系统并列放置。两者不共享智能体、记忆或搜索状态;相反,每个系统都独立地利用先前的实验输出来改进自己领域内的后续提案。

#### 自主研究智能体。

在金融之外的领域,语言模型智能体已被用于端到端运行科学过程29 (https://arxiv.org/html/2608.12841#bib.bib1);32 (https://arxiv.org/html/2608.12841#bib.bib27);55 (https://arxiv.org/html/2608.12841#bib.bib37);45 (https://arxiv.org/html/2608.12841#bib.bib36)。同样的智能体模式也已进入交易领域,由语言模型组成的多智能体团队会提出并执行投资决策31 (https://arxiv.org/html/2608.12841#bib.bib38);35 (https://arxiv.org/html/2608.12841#bib.bib39)。我们采纳了同样的自主研究循环目标,但在两个量化学科中分别研究递归自改进:因子发现和模型开发。在每个学科中,一次迭代中经过验证的证据会被保留,并用于改进后续研究决策。我们还专门针对量化工作的特定失效模式——数据泄漏,通过将数据路径和评估器置于智能体不可达之处,而不是依赖其判断来加以应对。

#### 金融时间序列的深度模型。

Part II 中的模型借鉴了标准序列建模组件,包括卷积序列网络4 (https://arxiv.org/html/2608.12841#bib.bib10)、状态空间模型15 (https://arxiv.org/html/2608.12841#bib.bib11)和注意力39 (https://arxiv.org/html/2608.12841#bib.bib12),以及专为金融数据设计的深度架构52 (https://arxiv.org/html/2608.12841#bib.bib3);16 (https://arxiv.org/html/2608.12841#bib.bib22)。最近的一波工作将混合循环、卷积和 Transformer 模型(通常与强化学习、图或基础模型组件结合)应用于股票收益与投资组合预测23 (https://arxiv.org/html/2608.12841#bib.bib40);28 (https://arxiv.org/html/2608.12841#bib.bib41);36 (https://arxiv.org/html/2608.12841#bib.bib42);2 (https://arxiv.org/html/2608.12841#bib.bib43);41 (https://arxiv.org/html/2608.12841#bib.bib44);1 (https://arxiv.org/html/2608.12841#bib.bib45);25 (https://arxiv.org/html/2608.12841#bib.bib46)。我们的贡献不是新的模型原语,而是一个独立的自主循环,它允许智能体将这些原语组合成模型,并在不同变体之间积累证据。它与 Part I 的关系是概念性的——两个系统都从先前实验中学习——而非架构性的。

## 3 方法概述

AQuA 的 Part I 和 Part II 是独立的研究系统。它们不共享智能体、记忆、候选空间或研究状态。我们将它们放在一起描述,仅仅是因为两者都表现出相同的高级模式:每个系统都利用先前实验中经过验证的证据,来指导自己领域内的后续研究决策。

在每个部分内部,一次迭代经历五个阶段。它从一个*假设*开始:在 Part I 中是一个候选因子,在 Part II 中是一个模型配置。该假设被*构建或训练*成具体产物,在留出数据上接受*评估*,并针对前视偏差和市场状态依赖进行*验证*。存活的产物随后被*选择或组合*成为该部分的运行输出:Part I 中是组合因子信号,Part II 中是交易模型。最后的*持久研究状态更新*将本次迭代的证据写入该部分所属的存储,下一次迭代在提出新假设之前会参考该存储。这一反馈使每个系统都不同于一次性流水线:后续迭代积累并复用证据,而不是从头开始。

对于部分 \(p\in\{\mathrm{I},\mathrm{II}\}\),设 \(R_t^{(p)}\) 表示第 \(t\) 次迭代之前的持久研究状态,\(H_t^{(p)}\) 表示其假设,\(C_t^{(p)}\) 表示构建的因子或训练的模型,\(E_t^{(p)}\) 表示实验返回的经过验证的证据。部分内的递归为

\[
R_{t+1}^{(p)}=\mathcal{U}_{p}\!\left(R_{t}^{(p)},H_{t}^{(p)},C_{t}^{(p)},E_{t}^{(p)}\right),\qquad\left(H_{t+1}^{(p)},C_{t+1}^{(p)}\right)\sim\mathcal{P}_{p}\!\left(\cdot\mid R_{t+1}^{(p)}\right).
\tag{1}
\]

特定部分的更新 \(\mathcal{U}_{p}\) 将实验输出转换为可复用的研究知识,而 \(\mathcal{P}_{p}\) 利用这些知识指导下一个提案。上标强调了分离性:Part I 不更新 \(R^{(\mathrm{II})}\),Part II 不更新 \(R^{(\mathrm{I})}\)。我们在这个有界的、研究过程层面的意义上使用*递归自改进*;两个系统都不会更新底层语言模型或评估器。

因此,共同点是高级研究模式,而非共享实现。构建阶段在 Part I 中写入符号因子表达式,在 Part II 中训练混合时间序列模型;评估阶段两者都报告信息系数,但采用各自特定的约定,因此这两个系数不可直接比较,我们分别报告。

### 3.1 封闭沙箱与受限迭代

由于语言模型提出实验并在某些情况下编写自己的实验,核心失效模式是数据泄漏:由自主生成的特征、标签或归一化操作在预测时查阅了不可获得的信息。这类回测过拟合已有充分记录,会产生无法在样本外存续的模拟表现6 (https://arxiv.org/html/2608.12841#bib.bib8);5 (https://arxiv.org/html/2608.12841#bib.bib9);20 (https://arxiv.org/html/2608.12841#bib.bib23)。我们通过在任何迭代开始前固定一个沙箱来从结构上遏制这一问题。数据划分 \(\mathcal{D}\)、特征与标签定义 \(\mathcal{F}\) 和 \(\mathcal{L}\)、以及评估器 \(\mathcal{V}\) 都是密封的、由人工编写的,模型永远不会编辑它们。模型的每个动作都是来自受限空间 \(\Theta\) 的规格说明 \(\theta\),该空间不包含修改或绕过数据路径与评估器的操作。因此,智能体无法通过生成代码来改变其被评判的方式。

相似文章

QuantAgent:基于价格驱动的多智能体大语言模型高频交易框架

Papers with Code Trending

QuantAgent 是一个专为高频交易设计的多智能体大语言模型框架,通过四个专业智能体(指标、形态、趋势、风险)基于短周期信号快速做出具有风险意识的交易决策。在对比比特币和纳斯达克期货在内的十种金融工具的零样本评估中,该框架在预测准确率和累计收益方面均优于现有的神经网络和规则驱动基线模型。