EVOQUANT: 自我进化的验证器引导策略优化,用于稳健的量化交易

arXiv cs.AI 论文

摘要

提出了EVOQUANT,一个自我进化的框架,利用LLM和验证器流水线自动化量化交易策略优化,在A股和加密货币市场上实现了夏普比率的显著提升。

arXiv:2607.12455v1 公告类型:新 摘要:量化策略优化在很大程度上仍然是手动的,需要领域专家识别微弱信号、调整风险控制规则,并反复验证迭代修改。大型语言模型可以加速这一过程,但直接依赖它们重写交易策略常常会导致幻觉编辑、策略漂移和回测过拟合。我们提出了EVOQUANT,一个用于量化交易策略优化的自我进化验证器引导框架。我们的方法利用LLM深入诊断性能瓶颈,生成语义控制的候选编辑,通过多阶段验证流水线选择最佳策略,并将优化经验提炼为可重用的知识,以实现持续的自我改进。我们使用七个代表性策略评估了我们的方法:四个来自A股市场,三个来自加密货币市场。实验结果表明,我们的方法在所有测试策略上显著提高了夏普比率:平均测试夏普比率从-0.298提高到0.538,表现最好的策略实现了199%的相对提升。在更严格条件下的消融研究和压力测试进一步验证了该框架的有效性和鲁棒性。总体而言,这项工作将量化策略优化从昂贵的手动试错转变为自动可验证的迭代范式,为将大型语言模型应用于金融策略研究提供了新路径。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:20

# 面向稳健量化交易的自演化验证器引导策略优化  
来源: https://arxiv.org/html/2607.12455  

毛杰1,∗,李昌伦1,2,∗,李想1,段琦琦2,袁金辉1,刘翔1,  
罗玉宇1,2,唐静1,褚晓文1,唐南1,2,†  

1香港科技大学(广州)  
2Paradoox AI Research  
∗共同第一作者。  
†通讯作者: [email protected]  

###### 摘要  

量化策略优化在很大程度上仍依赖人工操作,需要领域专家识别微弱信号、调整风险控制规则并反复验证迭代改进。大语言模型可以加速这一过程,但直接依赖它们重写交易策略往往会引入幻觉编辑、策略漂移和回测过拟合。我们提出**EvoQuant**,一种用于量化交易策略优化的自演化验证器引导框架。我们的方法利用LLM深入诊断性能瓶颈,生成语义受控的候选编辑,通过多阶段验证流水线选出最优策略,并将优化经验提炼为可复用知识以实现持续自我改进。我们使用七种代表性策略进行评估:四种来自A股市场,三种来自加密货币市场。实验结果表明,我们的方法在所有测试策略上显著提升了夏普比率:测试集平均夏普比率从−0.298提升至0.538,表现最佳的策略实现了199%的相对改善。在更严苛条件下的消融研究和压力测试进一步验证了该框架的有效性和鲁棒性¹¹¹我们的代码可在 https://anonymous.4open.science/r/EVOQUANT 获取。。总体而言,本工作将量化策略优化从昂贵的人工试错转变为自动化、可验证的迭代范式,为大语言模型应用于金融策略研究开辟了新路径。  

EVOQUANT: 面向稳健量化交易的自演化验证器引导策略优化  

毛杰1,∗,李昌伦1,2,∗,李想1,段琦琦2,袁金辉1,刘翔1,  
罗玉宇1,2,唐静1,褚晓文1,唐南1,2,†  

1香港科技大学(广州)  
2Paradoox AI Research  
∗共同第一作者。  
†通讯作者: [email protected]  

## 1 引言  

量化策略开发从根本上是一个迭代的科学过程:研究者提出可检验的市场假说,实现交易规则,通过严格的回测验证其表现,诊断失败模式,修正假说,并持续重复这一循环以适应非平稳的市场体制(Noormohammadzadehmalekiet al., 2026; Zhouet al., 2025; Liet al., 2025a,b)。如图1(a)所总结,传统的人工优化量化策略受限于领域专家稀缺、重复的繁琐分析、低迭代效率以及难以突破的性能瓶颈(Wanget al., 2023; Yuet al., 2023)。如图1(b)所示,现代大语言模型(LLM)代理有望通过自动化代码生成、假说测试和策略优化来显著加速这一迭代循环(Luoet al., 2025; Tanget al., 2025a; Donget al., 2025)。然而,将通用大语言模型直接应用于量化金融也引入了新的关键挑战。具体来说,这些模型容易生成幻觉性的交易规则,产生不可验证且无法执行的策略修改,并且无法为其提出的变更提供透明的因果解释(Wuet al., 2025; Liet al., 2024a)。一个生成大量候选策略的系统可能通过利用有噪声的验证窗口、低交易次数或未报告的自由度来显得令人印象深刻(White, 2000; Baileyet al., 2015; Harvey, 2013)。因此,核心问题不仅仅是生成策略,而是在一个记录、验证并拒绝不安全编辑的协议下改进策略。  

(请参见图题)  
图1:动机。与人工优化和基础LLM重写相比,EvoQuant提供了一个验证器引导的闭环,用于可控且可靠的策略改进。  

现有的LLM驱动的量化金融研究专注于自主交易策略构建和alpha因子挖掘(Kouet al., 2024; Tanget al., 2025b; Wanget al., 2026; Liet al., 2025c; Tianet al., 2025)。相比之下,我们研究了一个更具实际影响力但尚未被充分探索的问题:系统性地改进现有已部署的量化策略。图1(c)展示了我们提出的优化框架的工作流程和优势。我们的框架以用户提供的量化策略作为输入。与无约束的生成式搜索不同,我们将自动化策略优化视为一个闭环的科学过程。在这个过程中,系统明确表示底层假说,诊断当前失败模式,引导LLM逐步生成受控的优化假说,并且只有在修改通过严格的多阶段验证流水线后才被采纳。所提出的方法通过四个技术原则来实现这一设计。(i) 它将原始策略逻辑转换为类型化的策略基因组。这个基因组作为一种可编辑的中间表示,支持从参数调整、局部结构修复到逻辑重写的各种干预。(ii) 它构建了一个基于LLM的策略风险诊断代理。通过整合多个时间段的回测证据,该代理从交易行为、风险暴露和市场兼容性等角度分析失败模式,从而识别当前策略的核心弱点。(iii) 候选生成以诊断结果为基础,并组织成具有递增表达能力的层次结构。在LLM的引导下,系统从保守的局部调优逐步推进到结构重构、策略家族迁移和假说重写。每个候选方案都作为对策略基因组的显式编辑计划发出,从而在优化过程中实现漂移约束,并在事后提供溯源审计。(iv) 一个样本外感知的验证器和一个自适应提升引擎通过硬性准入规则和鲁棒性惩罚共同筛选候选方案。只有当候选方案通过所有验证阶段后,才会替换当前的优胜策略。此外,内置的知识蒸馏模块持续从优化过程中提炼有效经验,形成可复用的策略知识库,使系统能够持续自我改进。  

我们评估了这一迭代过程是否能在股票市场和加密货币市场中都改进量化策略,同时减轻单一资产的伪影和优化过拟合。在七个代表性策略上,该系统持续提高了测试性能,平均夏普比率从−0.298提升至0.538,表现最佳的策略实现了199%的相对改善。消融和压力测试结果进一步表明,诊断、基于LLM的候选生成、自适应提升和可复用记忆都对稳健的优化增益有所贡献。  

我们的贡献如下:  

- **证据约束的策略演化**。我们将自动化量化策略改进形式化为证据约束的程序演化,其中用户提供的策略被表示为结构化的交易基因组,支持局部化、可执行且保留溯源信息的编辑。  
- **LLM启用的验证器引导优化协议**。我们开发了一个验证器引导的优化框架,利用LLM进行失败模式诊断和分层候选合成,同时将样本外感知验证、自适应提升和基于记忆的经验复用集成到一个统一的、可审计的循环中。  
- **长周期跨市场评估**。我们提供了跨A股和比特币策略的长周期实证评估,包括优化前后性能对比、组件消融、交易成本压力测试以及递推验证。  

## 2 相关工作  

**回测过拟合与数据窥探**。金融机器学习早已认识到,重复的策略搜索可能通过数据窥探和回测过拟合来夸大表面性能(White, 2000; Baileyet al., 2015)。实际处理方法强调避免信息泄漏的验证(Schwendner, 2020),近期理论则量化了样本内到样本外夏普比率的衰减(Jacquieret al., 2025)。我们的工作通过记录被拒绝的候选方案、暴露低交易失败、跟踪验证-测试行为以及报告非退化(而非仅报告发现的最佳策略)来解决这一问题。  

**LLM代理与迭代优化**。LLM代理能够通过反馈循环进行推理、行动和输出修订(Yaoet al., 2022; Shinnet al., 2023; Madaanet al., 2023),近期金融代理将这一模式扩展到市场分析、因子挖掘和工具增强的交易中(Zhanget al., 2024; Liet al., 2024b; Zhanget al., 2025)。较新的基准测试和批评指出了LLM交易代理的不稳定性和部署证据不足(Zhanget al., 2026; Yeet al., 2026)。EvoQuant的不同之处在于,它将每次策略编辑都基于时间序列回测、交易覆盖检查、成本假设和风险敏感的提升机制。  

**程序化策略搜索**。程序化策略搜索已从进化式和符号化的alpha发现(Kakushadzeet al., 2016; Cuiet al., 2021)转向利用强化学习、LLM代理、结构感知搜索和专用评估协议的自动化公式化alpha挖掘(Shiet al., 2024; Zhaoet al., 2024; Tanget al., 2025b; Dinget al., 2025; Chenet al., 2025; Yanget al., 2026; Wanget al., 2026)。这些方法扩展了候选生成和评估的规模,但广阔的搜索空间可能模糊收益究竟是源于对初始市场假说的原则性改进,还是来自众多自由度中的选择。EvoQuant则将优化视为从用户提供的策略出发的受约束程序演化,具有类型化基因组编辑、基于诊断的生成、样本外感知的提升关卡和明确的审计轨迹。  

## 3 方法论  

EvoQuant将量化策略优化视为**验证器引导的程序演化**。如图2所示,系统包含四个模块:策略摄入与表示、基线证据构建、诊断-生成优化循环,以及最终策略优化/输出。我们框架的核心设计强调实际执行而非纯粹生成。大语言模型在可控范围内提出策略修订,而包括回测器和验证器在内的组件共同决定这些修订是否可接受。在第t轮,当前优胜基因组g_t被评估生成证据包E_t。优化循环诊断当前瓶颈,生成候选集C_t,并仅提升一个经过验证的候选方案:  

g_{t+1} = 
\begin{cases} 
c^{\star}_t, & \text{如果 } c^{\star}_t \text{ 被 } \Pi \text{ 接受}, \\
g_t, & \text{否则}.
\end{cases}

其中c^{\star}_t是从C_t中选出的最佳已验证候选方案,Π表示稍后在模块3中指定的提升规则。该循环采用保守设计:失败的候选方案连同拒绝原因一起存储,后续用于避免重复无效编辑。  

(请参见图题)  
图2:EvoQuant工作流程分为四个模块。模块1将原始策略代码或逻辑规范化为类型化的策略基因组。模块2构建时间序列基线证据。模块3执行迭代的诊断-生成循环,包括瓶颈诊断、受控候选编辑、验证以及带记忆更新的提升。模块4输出最佳验证策略、优化轨迹和报告。  

### 3.1 模块1:策略摄入与表示  

EvoQuant首先将用户策略规范化为一种称为**策略基因组**的类型化中间表示。该模块执行四个步骤。首先,它将原始代码或规则文本解析为抽象语法树。其次,它标记交易语义,如信号、入场条件、风险规则、仓位规模和离场条件。第三,它将策略分解为可编辑的层次。最后,它重新编译基因组以确保表示仍可执行。形式上,解析器Φ将策略s映射为:  

Φ(s) = g = (g^{\mathrm{sig}}, g^{\mathrm{risk}}, g^{\mathrm{pos}}, g^{\mathrm{entry}}, g^{\mathrm{exit}}, ξ),  

其中ξ存储溯源信息、策略家族、父标识符和突变历史。该模块的输出不仅仅是一个解析后的程序,而是一个可编辑的研究对象。后续的编辑必须指定目标层,满足非前瞻性和暴露约束,并且能够编译回可执行的策略语义g。  

### 3.2 模块2:基线评估与证据构建  

EvoQuant在尝试改进策略之前,先测量原始策略。评估器加载真实市场数据,构建时间序列分割,并在与所有未来候选方案相同的执行假设下运行当前优胜基因组。它记录标量指标和行为画像,生成:  

E(g) = { M_X, P_X^{\mathrm{trade}}, P_X^{\mathrm{regime}} }_{X \in \{\mathrm{train}, \mathrm{val}, \mathrm{test}\}}

相似文章

AQuA:递归自我改进的量化交易研究智能体

arXiv cs.CL

AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。

AlgoEvolve: LLM驱动的算法交易程序元进化

arXiv cs.AI

介绍了AlgoEvolve,一个LLM驱动的进化框架,用于生成并迭代改进算法交易策略。该框架包含一个元进化外层循环,用于进化提示词以指导内层循环的合成。

QuantAgent:基于价格驱动的多智能体大语言模型高频交易框架

Papers with Code Trending

QuantAgent 是一个专为高频交易设计的多智能体大语言模型框架,通过四个专业智能体(指标、形态、趋势、风险)基于短周期信号快速做出具有风险意识的交易决策。在对比比特币和纳斯达克期货在内的十种金融工具的零样本评估中,该框架在预测准确率和累计收益方面均优于现有的神经网络和规则驱动基线模型。