OpenFinGym:一个可验证的多任务Gym环境,用于评估量化交易Agent
摘要
本文介绍了OpenFinGym,这是一个统一的多任务Gym环境,用于评估量化金融中的大语言模型Agent,涵盖预测、市场生成、实时交易和欺诈检测,具备可验证执行和自动化任务构建功能。
arXiv:2606.26350v1 Announce Type: new
Abstract: 尽管大语言模型Agent越来越多地应用于量化金融工作流程,但其评估仍然分散在孤立的任务中,且基准任务的金融相关性常被忽视。然而,金融工作流程本质上是多阶段的,涉及预测、策略构建、风险管理和交易等相互依赖的任务。现有平台通常只关注单一任务,因此可能夸大Agent的能力,而无法揭示其在泛化、真实市场交互以及具有金融意义的决策方面的弱点。我们提出了OpenFinGym,这是一个统一的Gym环境,用于量化金融Agent开发,在单一的执行和验证接口下涵盖预测、市场生成、实时交易和欺诈检测。OpenFinGym还提供了一个自动化的任务构建流水线,可将量化金融出版物转化为可执行的任务包;一个容器化的运行时环境,配有主机端验证器服务,支持可扩展的Agent部署并防止运行时训练-测试泄漏;一个低延迟数据流设计的模拟交易引擎;对长期和事件市场预测的延迟解析支持;以及与SFT和RL后训练的集成。
查看缓存全文
缓存时间: 2026/06/26 05:12
# 一个用于评估量化智能体的可验证多任务Gym环境 来源:https://arxiv.org/html/2606.26350 Kaicheng Zhang1, Wen Ge2,∗ Lei Jiang3 Weixin Yang2 Jordan Langham\-Lopez3 Jialin Yu4 Lukasz Szpruch1, Hao Ni2,† 1 University of Edinburgh 2 University College London 3 Alan Turing Institute 4 University of Oxford K.Zhang\[email protected] {wen.ge.25, weixin.yang, h.ni}@ucl.ac.uk {ljiang, jlanghamlopez}@turing.ac.uk, [email protected] [email protected] ###### 摘要 尽管大型语言模型智能体越来越多地被应用于量化金融工作流,但对其评估仍分散在孤立的任务中,而基准任务中的金融相关性常被忽略。然而,金融工作流本质上是多阶段的,涵盖预测、策略构建、风险管理和交易等相互依赖的任务。现有的平台通常只关注单一任务,因此可能夸大智能体的能力,无法揭示其在泛化能力、真实市场交互以及具有财务意义的决策方面的缺陷。我们提出了OpenFinGym,一个统一的量化金融智能体开发Gym环境,它在单一执行和验证接口下覆盖了预测、市场生成、实时交易和欺诈检测。OpenFinGym还提供了一个自动化任务构建管道,可将量化金融出版物转化为可执行的任务包;一个容器化运行时,带有一个主机端验证器服务,支持可扩展的智能体部署并防止运行时训练–测试泄漏;一个带有低延迟数据流设计的模拟交易引擎;支持长期和事件市场预测的延迟解析能力;以及用于监督微调(SFT)和强化学习(RL)后训练的集成功能。[代码将在发表时提供。] OpenFinGym:一个用于评估量化智能体的可验证多任务Gym环境 Kaicheng Zhang1,††††注:同等贡献。Wen Ge2,∗ Lei Jiang3 Weixin Yang2 Jordan Langham\-Lopez3 Jialin Yu4 Lukasz Szpruch1,††††注:通讯作者。Hao Ni2,† 1 University of Edinburgh 2 University College London 3 Alan Turing Institute 4 University of Oxford K.Zhang\[email protected] {wen.ge.25, weixin.yang, h.ni}@ucl.ac.uk {ljiang, jlanghamlopez}@turing.ac.uk, [email protected] [email protected]  图1: OpenFinGym架构的高层概览 ## 1 引言 在过去两年中,量化金融已成为自主大型语言模型智能体的测试场(Zhang等,2024;Yu等,2025b,2024)。早期研究探讨深度模型能否在预测或交易任务上超越经典基线(Gu等,2020b;Sun等,2023;Liu等,2022),而近期系统将LLM本身视为研究员:一个选择数据、设计特征、训练模型、生成预测或执行交易的智能体。这一转变改变了评估和训练基础设施所需支持的内容。任务面应涵盖未来价格预测(jun Gu等,2024;Wang等,2024)、生成用于压力测试的合成市场场景(Hounwanou和Gaba,2025)、在历史与实时数据上执行交易(Zong等,2024;Kashif和Ślepaczuk,2025),以及在交易图中检测异常(Li等,2024)。同时还应涵盖交互模式,从在历史数据上一键批量提交,到在流式市场数据源上逐步决策。 尽管现有平台如FinRL-Meta(Liu等,2022)、TradeMaster(Sun等,2023)提供了Gym式的交易环境,而领域通用的Gym环境如DSGym(Nie等,2026)和TimeSeriesGym(Cai等,2025)可以处理静态任务如批量预测,但前者限于交易,后者并未专门针对金融。然而,金融任务在实践中是相互关联的:预测可以指导交易,生成的场景可以压力测试策略,异常信号可以告知风险管理。目前没有现有平台能在统一的执行和验证接口下,提供跨预测、生成、交易和异常检测任务的智能体评估与训练环境,而这对于评估智能体是否能在金融工作流中执行并泛化至关重要。此外,在金融等高风险领域,可扩展的任务构建必须与严格的验证相结合:任务应反映有意义的金融工作流,同时确保可重复性、泄漏控制,并基于隐藏真实值进行评估。 我们提出OpenFinGym,一个填补这一空白的统一量化金融智能体开发Gym环境。OpenFinGym包含78个精心策划的任务,涵盖四个任务家族,并配有自动化的文献到任务管道。智能体在排除保留测试集真实值的容器内运行,并将预测或动作提交给主机端验证器服务以计算奖励。低延迟数据流服务、模拟交易引擎和持久的SQLite账本将同一接口扩展到实时交易、长期价格与预测市场预测。我们在OpenFinGym上对四个前沿LLM进行了基准测试,发现存在任务家族特定的领先者,而非单一主导模型。我们还展示了OpenFinGym作为后训练环境的实用性,其中SFT和GRPO后训练将Qwen3基础模型在保留预测任务上的可执行生成成功率从0%提升到100%,并在国债任务上使奖励提升了一个数量级。 我们的贡献如下: - • 一个由78个经过验证的量化金融任务组成的策划任务套件,涵盖四个不同的任务家族,基于已有文献构建并扩展到实时金融市场环境。 - • 一个自动化任务构建管道,可将学术量化金融论文转化为可执行且可验证的任务包。 - • 一个容器化运行时,将智能体可见信息与仅验证器使用的真实值分离,实现对批量任务和顺序任务的抗泄漏评估。 - • 一个用于评估和训练量化金融智能体的Gym环境,支持监督微调和强化学习。 | 任务覆盖 | 运行时 | 智能体生命周期 | 系统 | |----------|--------|----------------|------| | 预测 | 交易(离线) | 交易(实时) | 市场生成 | 欺诈检测 | 泄漏控制 | 低延迟 | 自动任务构建 | SFT/RL集成 | | 量化金融智能体系统 | | | | | | | | | | FinRL-Meta(Liu等,2022) | – | ✓ | ∼ | – | – | ✓ | – | – | ∼ | | FinBen(Xie等,2024) | ∼ | ✓ | – | – | ✓ | – | – | – | ✗ | | INVESTORBENCH(Li等,2025a) | – | ✓ | – | – | – | – | – | – | – | | Agent Market Arena(Qian等,2025) | – | – | ✓ | – | – | ∼ | – | – | – | | 通用容器化智能体Gym | | | | | | | | | | | SWE-Bench(Jimenez等,2024) | – | – | – | – | – | ✓ | – | ∼ | – | | TimeSeriesGym(Cai等,2025) | ✓ | – | – | – | – | ✓ | – | ∼ | – | | Harbor(Harbor Framework团队,2026) | – | – | – | – | – | ✓ | – | – | ✓ | | OpenFinGym(本工作) | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | 表1:OpenFinGym与竞争系统在任务覆盖、运行时特性和智能体生命周期支持方面的比较。✓表示完全支持,∼表示部分支持,–表示不支持。 ## 2 相关工作 金融智能体环境包括强化学习交易平台如FinRL-Meta(Liu等,2022)、TradeMaster(Sun等,2023),量化研究框架如Qlib(Yang等,2020),以及市场微观结构模拟器如ABIDES-Gym(Amrouni等,2021)。这些系统主要支持量化研究、交易和模拟,而非基于金融文献的可执行智能体基准测试。金融LLM基准测试,包括PIXIU(Xie等,2023)、FinBen(Xie等,2024)、FinanceBench(Islam等,2023),在大部分静态数据集和评估协议上评估金融推理和分析能力。近期工作聚焦于可执行智能体评估。SWE-Bench(Jimenez等,2024)、AgentBench(Liu等,2024)和WebArena(Zhou等,2024)在自主环境中评估智能体,而DSGym(Nie等,2026)、TimeSeriesGym(Cai等,2025)和Harbor(Harbor Framework团队,2026)将这一范式扩展到数据科学、时间序列和容器化执行设置中。OpenFinGym建立在这些工作之上,但针对金融特有的挑战,如时间泄漏和基于经济的评估。同时,还有研究进一步探索LLM驱动的金融智能体在实时或半实时市场中的表现,如StockBench(Chen等,2025)、LiveTradeBench(Yu等,2025a)和When Agents Trade(Qian等,2025)。其他工作强调了金融智能体评估中的前瞻性风险、时间污染和基准泄漏(Benhenda,2026;Li等,2025b;Xu等,2024)。OpenFinGym通过基于文献的任务构建和验证器隔离评估,位于可执行智能体评估与量化金融基准测试的交汇点。 ## 3 开放金融Gym OpenFinGym旨在支持对量化金融智能体进行严格、可扩展且抗泄漏的评估。OpenFinGym涵盖更广泛的金融工作流家族,包括预测、交易、市场生成和欺诈检测。该基准围绕三个组件组织:一个可重用的量化金融知识库,一组具有代表性且经过验证的任务,以及一个用于评估和训练智能体的Gym风格执行环境。整体架构如图1所示。 ### 3.1 任务规范 ##### 统一的任务抽象。 OpenFinGym中的量化金融任务被形式化为机器学习问题。形式上,每个任务由一个三元组 \((\mathcal{D}, \mathcal{T}, \mathcal{E})\) 表示,其中: - \(\mathcal{D}\) 表示数据集,包括训练集和测试集划分; - \(\mathcal{T}\) 指定任务描述,包括数据来源、输入输出接口、预测或决策目标、所需输出格式以及任务的总体目标; - \(\mathcal{E}\) 表示用于评估智能体性能的评估协议。评估协议可包含多个指标,以及一个定义最终任务得分的聚合规则。 这一形式化为表示异构的量化金融问题提供了统一接口。 每个任务被打包成一种标准化格式,该格式基于Harbor框架(Harbor Framework团队,2026)扩展而来。一个任务包包含面向智能体的指令、任务接口模块、数据负载、用于执行和编排的配置文件,以及运行时所需的评估组件。一个关键设计原则是智能体可用信息与仅用于验证的信息之间的分离。在评估过程中,智能体可以访问训练集和测试集的输入特征,但相应的标签、已实现结果或隐藏的评估状态被保留,仅对验证器可用。这种分离减少了泄漏风险,并允许在同一智能体上评估来自异构任务源的任务,而无需任务特定的粘合代码。  | 任务类型 | 资产类别 | 任务数量 | |----------|----------|----------| | 预测 | 股票、商品、外汇、加密货币、LOB、收益率曲线 | 48 | | 市场模拟 | 股票、外汇、加密货币、LOB、合成过程 | 13 | | 交易 | 股票、加密货币 | 10 | | 欺诈检测 | 交易信号、行为信号、图结构信号 | 7 | 表2:Gym中策划的金融任务的任务类型分布(上)和资产类别分解(下)。 ##### 任务分类。 OpenFinGym涵盖四个任务家族。 1. **预测**。预测任务要求智能体基于历史观察和其他预测信号,预测未来的金融量,如收益率、价格、波动率、收益率曲线变动或市场状态。这些任务使用统计指标如 \(R^2\)、RMSE 和方向准确率进行评估,以及衡量预测的下游经济价值或风险特征的金融特定指标。 2. **交易**。交易任务要求智能体在观测到的市场快照上采取顺序交易动作。离线交易任务在历史数据上评估策略,而实时交易任务要求与实时市场观测进行顺序交互。评估指标包括损益、夏普比率、回撤、换手率以及具有可配置交易成本和价格滑点的回报。 3. **市场生成**。市场生成任务评估智能体是否能生成逼真的金融时间序列、市场状态或场景分布。生成的样本使用分布性、时间性和金融诊断与真实数据进行比较,包括分布得分、基于统计的得分(例如自相关得分、边际分布得分)、波动率、尾部和收益率动态统计量。 4. **欺诈检测**。欺诈检测任务被形式化为分类、排序或异常检测问题。目标是识别欺诈性、可疑或异常的金融活动。评估指标包括AUROC、召回率和依赖阈值的操作指标。 任务目录跨越多种资产类别,包括股票、指数、外汇(FX)、商品、加密资产、利率、限价订单簿(LOB)微观结构和预测市场,以及不同频率,从日内到月度观测,以及图结构数据。它包括源自学术文献的离线任务,以及智能体必须在相关市场或事件结果可观察之前采取行动的实时任务。
相似文章
CUA-Gym: 为计算机使用代理扩展可验证的训练环境与任务
CUA-Gym 引入了一个可扩展的流水线,用于为计算机使用代理生成可验证的训练环境和任务,从而解决数据稀缺问题。由此产生的数据集和模型在OSWorld-Verified和WebArena等基准测试上取得了强劲的性能。
AutoGym:蓝图优先的可验证智能体训练环境生成
AutoGym提出一个框架,通过蓝图优先生成,从最小种子自动生成完整的智能体训练环境(包括任务、可执行环境和验证器),以确保可解性并实现主动课程综合,用于自适应难度调控。
Workflow-GYM:面向真实世界专业领域中计算机使用代理任务的长期评估
Workflow-GYM 是一个用于评估 AI 代理在专业领域中长期 GUI 任务的基准。实验表明,即使是最先进的模型也仅能达到约 30% 的成功率,揭示了重大挑战。
ShopGym:一个用于电子商务网络代理的现实模拟和可扩展基准测试的集成框架
ShopGym 是一个框架,它将实时的电子商务店面转换为自包含的沙盒商店,用于对网络代理进行真实、可控和可重复的基准测试,并包含涵盖七类技能的合成任务。
MobileGym: 一个可验证且高度并行的移动GUI代理研究仿真平台
MobileGym是一个基于浏览器的移动GUI代理研究仿真平台,具有确定性状态评估和可扩展的并行执行功能。它包含一个包含416个任务的基准测试,并展示了在Qwen3-VL-4B上使用GRPO带来的提升。