Backtrader-Bench:基于自生成多选题的算法交易LLM智能体基准测试

arXiv cs.CL 论文

摘要

介绍了Backtrader-Bench,这是一个用于评估算法交易中LLM编码智能体的基准,采用自生成的多选题和生成器-求解器过滤流程,展示了工具增强型智能体达到90%的准确率。

arXiv:2608.11232v1 公告类型:新 摘要:评估算法交易中的LLM编码智能体很困难,因为静态基准存在数据污染风险,而数值回测输出需要来自实际代码执行的真实值。我们提出了Backtrader-Bench,一个具有两条互补流程的框架。一条确定性的多选题(MCQ)流程从回测配置中生成问题,涵盖五种交易策略、33个模板和三个难度等级,并由独立检查器重新推导每个答案。一条生成器-求解器过滤流程自主挖掘更难的问题:生成器编写经可执行代码验证的问题,将其转换为多选题,并丢弃任何无需代码执行即可由无工具求解器回答的问题。我们评估了11个无工具模型(每个10次运行)和四种带工具配置,在一个30道题的精选集上。工具增强型智能体在一次通过中达到90.0%的准确率(GPT-5.5和Opus 4.7),比最佳无工具基线(10次运行平均73.0%)高出17个百分点。在另外挖掘的38道题上,无工具准确率进一步下降,一半模型降至接近随机水平(25%)。除评估外,可扩展的MCQ基础设施旨在为强化学习生成训练语料库,最终目标是构建一个专门用于量化交易工作流的智能体。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:24

# Backtrader-Bench:基于自生成多项选择题对算法交易中的 LLM 智能体进行基准测试
来源:https://arxiv.org/html/2608.11232
Maziar Raissi
加州大学河滨分校
ruoxi\.zhao@email\.ucr\.edu, maziar\.raissi@ucr\.edu

###### 摘要
评估算法交易中的 LLM 编码智能体颇具挑战性,因为静态基准测试存在数据污染风险,而数值回测输出又需要来自实际代码执行的真值。我们提出 Backtrader\-Bench,一个包含两条互补流水线的框架。一条确定性多项选择题(MCQ)流水线从五种交易策略、33 个模板和三个难度层级中的回测配置生成问题,并由一个独立检查器重新推导每个答案。一条生成器\-求解器过滤流水线自动挖掘更难的问题:生成器编写问题,由可执行代码验证,将其转换为多项选择题,并丢弃任何无需代码执行即可由无工具求解器回答的问题。我们在一个包含 30 个问题的精选集合上评估了 11 个无工具模型(每个运行 10 次)和 4 个带工具配置。工具增强型智能体在单次运行中达到 90.0% 的准确率(GPT\-5.5 和 Opus 4.7),比最佳无工具基线(73.0%,10 次运行平均值)高出 17 个百分点。在另外 38 个单独挖掘的问题上,无工具准确率进一步下降,其中一半模型降至接近随机水平(25%)。除基准测试外,可扩展的 MCQ 基础设施旨在为强化学习生成训练语料库,最终目标是构建一个专门用于量化交易工作流的智能体。
††已被 IJCAI 2026 的 FinLLM 研讨会接收。

## 1 引言
具备 shell 访问权限和迭代代码执行能力的大型语言模型(LLM)编码智能体现在可以处理复杂的软件工程任务Yaoet al\.\(2023 (https://arxiv.org/html/2608.11232#bib.bib22)\); Schicket al\.\(2023 (https://arxiv.org/html/2608.11232#bib.bib17)\); Jimenezet al\.\(2024 (https://arxiv.org/html/2608.11232#bib.bib7)\)。在金融领域,诸如 BloombergGPTWuet al\.\(2023 (https://arxiv.org/html/2608.11232#bib.bib18)\)之类的领域特定模型展示了强大的金融自然语言处理能力,像 FinRLLiuet al\.\(2020 (https://arxiv.org/html/2608.11232#bib.bib10)\)这样的强化学习库可自动进行策略优化,而包括 FinAgentZhanget al\.\(2024 (https://arxiv.org/html/2608.11232#bib.bib24)\)、TradingAgentsXiaoet al\.\(2024 (https://arxiv.org/html/2608.11232#bib.bib19)\)和 FinConYuet al\.\(2024 (https://arxiv.org/html/2608.11232#bib.bib23)\)在内的工具增强系统表明,将 LLM 与代码执行和多智能体协作相结合可以超越参数化基线。最近的综述描绘了这种快速进展,广泛涵盖了金融基础模型Chenet al\.\(2025 (https://arxiv.org/html/2608.11232#bib.bib3)\)以及金融领域的推理模型,如 DeepSeek\-R1Liuet al\.\(2025 (https://arxiv.org/html/2608.11232#bib.bib11)\),同时指出严格的领域特定评估和可靠的工具使用仍是悬而未决的挑战,这正是我们的基准测试所针对的空白。在评估方面,PIXIUXieet al\.\(2023 (https://arxiv.org/html/2608.11232#bib.bib20)\)、FinBenXieet al\.\(2024 (https://arxiv.org/html/2608.11232#bib.bib21)\)和 InvestorBenchLiet al\.\(2024 (https://arxiv.org/html/2608.11232#bib.bib9)\)等基准测试涵盖了金融自然语言处理任务和决策,但没有一个衡量智能体是否能正确*驱动*回测库:在给定配置下运行回测,解释其数值输出,并报告正确答案。这种能力在实践中很重要,因为回测的正确性依赖于策略逻辑、经纪商设置和仓位管理规则之间微妙的交互;一个误用的参数会产生看似合理但不正确的盈亏曲线,而任何肤浅的代码流利度都无法察觉。在量化金融中,这种静默错误会带来直接的财务后果:错误的夏普比率或低估的最大回撤可能导致投资组合经理对在真实条件下会失败的策略过度配置资金,从而将回测中的假象转化为实际交易损失。

尽管 Python 回测框架生态丰富(backtraderRodriguez \(2015 (https://arxiv.org/html/2608.11232#bib.bib16)\)、ziplineQuantopian Inc\. \(2012 (https://arxiv.org/html/2608.11232#bib.bib14)\)、vectorbtPolakow \(2017 (https://arxiv.org/html/2608.11232#bib.bib13)\)),现有评估针对的是策略*生成*。QuantCode\-BenchKhoroshilovet al\.\(2026 (https://arxiv.org/html/2608.11232#bib.bib8)\)是最接近的同期工作,它测试 LLM 能否从自然语言描述生成可执行的交易代码,但不测试策略*理解*,即智能体能否运行引擎并正确解释其输出。构建可靠的基准测试面临三个障碍:(1) 数据污染:静态基准测试Jimenezet al\.\(2024 (https://arxiv.org/html/2608.11232#bib.bib7)\); Chenet al\.\(2021 (https://arxiv.org/html/2608.11232#bib.bib2)\); Austinet al\.\(2021 (https://arxiv.org/html/2608.11232#bib.bib1)\); Jainet al\.\(2025 (https://arxiv.org/html/2608.11232#bib.bib6)\); Hendryckset al\.\(2021 (https://arxiv.org/html/2608.11232#bib.bib5)\); Reinet al\.\(2024 (https://arxiv.org/html/2608.11232#bib.bib15)\)一旦公开就无法再生成。(2) 真值保真度:数值输出必须来自智能体所采用的同一执行路径。(3) 大规模质量:自动生成会产生过于简单或格式错误的问题,而人工筛选无法扩展。我们通过 Backtrader\-Bench 解决了这三个问题,这是一个针对 backtraderRodriguez \(2015 (https://arxiv.org/html/2608.11232#bib.bib16)\)的工具增强型 LLM 智能体的抗污染基准测试框架。一条*确定性多项选择题(MCQ)流水线*运行回测,在三个难度层级和涵盖五种策略的 33 个模板中合成分层四选项问题,并通过独立检查器重新推导每个答案。问题在可配置种子下于运行时生成,因此答案密钥不必出现在公共网络上。一条*生成器\-求解器过滤流水线*自动生成更难的问题:生成器智能体编写问题并附带验证代码;验证后的问题转换为具有随机干扰项的多项选择题;无工具求解器丢弃简单问题;工具增强型求解器验证剩余问题。

我们在一个包含 30 个问题的精选集合上评估了 11 个无工具模型(每个运行 10 次)和 4 个带工具智能体配置。工具增强型智能体在单次运行中达到高达 90.0% 的准确率(GPT\-5.5 和 Opus 4.7),比最佳无工具基线(73.0%,10 次运行平均值)高出 17 个百分点。在另外 38 个 GPT\-5.4 过滤器无法无工具解决的单独挖掘问题上,无工具准确率进一步下降,其中一半模型降至接近随机水平(25%)。除基准测试外,这种可扩展 MCQ 生成基础设施的最终目标是生成大规模、经过验证的强化学习训练语料库,从而能够开发用于算法交易的领域特定编码智能体。

##### 贡献。
1. 1\.一个确定性、自验证的 backtrader MCQ 流水线,包含三个难度层级的 33 个模板,以及一个重新运行回测的逐题检查器。
2. 2\.一个生成器\-求解器过滤流水线,通过丢弃 GPT\-5.4 过滤器可以无工具解决的问题来自动挖掘更难的问题。
3. 3\.对 11 个无工具模型和 4 个带工具配置的经验评估表明,工具增强带来 17 个百分点的准确率提升,且在挖掘问题上无工具性能接近随机。

##### 实际意义。
此处测试的能力直接映射到量化工作流:配置回测引擎、运行策略变体,以及解释回撤和风险调整后收益等输出。随着 LLM 智能体被部署用于策略原型开发,衡量它们能否正确驱动真实的回测库成为安全采用的前提。

## 2 方法
本节描述了从 backtrader 回测中生成验证问题的确定性 MCQ 流水线(第2.1节 (https://arxiv.org/html/2608.11232#S2.SS1))以及自动筛选问题质量的生成器\-求解器过滤流水线(第2.2节 (https://arxiv.org/html/2608.11232#S2.SS2))。图1 (https://arxiv.org/html/2608.11232#S2.F1)展示了这两条工作流。

Config \(seed, ticker, strategy, dates\)MCQ BuilderMCQ Checker \(execute verifier\)Verified?failJSONL MCQ Set \(30 questions\)passAgent \(w/ tools\)Write/execute code, answerFresh sandboxReport: accuracy, time, tokensnext QOne\-shot \(no tools\)Answer as LLM one\-shotFresh sandboxReport: accuracy, time, tokensnext Q
\(a\) MCQ 流水线和 CLI 智能体评估。

Generator \(LLM\)Write text question \+ verification codeExecute verifierCode passes?DiscardfailConvert to MCQ\(random seed distractors\)passNo\-tool SolverSolved?Discard\(too easy\)yesTool SolverSolved?noSaveyesSave \+ notefor human reviewno
\(b\) 生成器\-求解器过滤流水线。

图 1:系统工作流。\(a\) MCQ 流水线生成并验证问题,然后将其分派给带工具智能体或无工具一次性评估器。\(b\) 生成器\-求解器过滤流水线:生成器编写带验证代码的自由形式文本问题;验证失败则丢弃问题。验证后的问题转换为具有随机干扰项的多项选择题。无工具求解器过滤掉无需代码执行即可解决的问题。工具增强型求解器验证剩余问题;未解决的问题连同人工审查说明一起保存。

### 2.1 数据收集:Backtrader_MCQ 流水线

#### 2.1.1 交易策略和指标
MCQ 流水线支持五种经典交易策略:SMA 交叉、滚动窗口均值、EWMA、RSI 和 MACD 交叉。这些策略使用了 backtrader 的核心 API(指标、交叉信号、仓位管理、经纪商配置),同时保持策略逻辑足够透明以进行无歧义的验证;更复杂的策略计划作为未来扩展(第6.0.1节 (https://arxiv.org/html/2608.11232#S6.SS0.SSS1))。SMA 交叉改编自 backtrader 的示例代码;其余四种改编自 Pik 和 GhoshPik and Ghosh \(2021 (https://arxiv.org/html/2608.11232#bib.bib12)\)。所有策略都继承自一个共享的插桩基类,该基类记录订单、交易和投资组合快照(附录A (https://arxiv.org/html/2608.11232#A1))。

#### 2.1.2 难度分类
33 个问题模板根据所需的计算步骤被分配到三个难度层级之一:简单(9 个模板):直接单值查找;中等(11 个):条件过滤或简单聚合;困难(13 个):多步衍生指标或带有替代参数的对比回测。模板是根据 backtrader 的绘图输出(图2 (https://arxiv.org/html/2608.11232#A5.F2))和标准量化金融指标设计的,然后在 Cursor(一个 LLM 驱动的编码智能体)的辅助下实现。完整的层级定义和示例模板见附录B (https://arxiv.org/html/2608.11232#A2);完整模板列表见附录C (https://arxiv.org/html/2608.11232#A3)。

#### 2.1.3 构建\-检查流水线
该流水线通过两个阶段产生验证问题(附录F (https://arxiv.org/html/2608.11232#A6)):构建阶段运行一次 Backtrader 回测,根据所选模板生成带有随机干扰项的多项选择题,并写入 JSONL 记录;检查阶段独立重新运行回测并重新推导每个答案,标记任何不匹配。两个阶段共享相同的确定性引擎,因此一致性为真值的内部一致性提供了强有力的保证。这种双重验证设计反映了量化金融中的标准实践,即在任何资本配置决策之前,回测结果都要经过独立复现。

#### 2.1.4 采样和可复现性
单个随机种子控制问题生成的所有随机方面(模板选择、干扰项生成、选项洗牌、日期/参数采样);回测本身是确定性的。160 个问题的数据集以“全部模板”模式(附录H (https://arxiv.org/html/2608.11232#A8))生成,涵盖五种策略的三个难度层级的全部 33 个模板。通过更改股票代码、日期范围或种子,可以生成新的问题集(附录I (https://arxiv.org/html/2608.11232#A9))。

### 2.2 生成器\-求解器过滤流水线

#### 2.2.1 动机
确定性流水线的模板是手工设计的且数量有限。为了扩展,我们让 LLM 自主生成问题,并使用两个具有互补能力的求解器智能体进行质量过滤(图1 (https://arxiv.org/html/2608.11232#S2.F1)b;附录G (https://arxiv.org/html/2608.11232#A7))。

#### 2.2.2 生成器和验证
生成器智能体编写一个自由形式的问题,并附带自包含的 Python 验证代码,该代码运行一次 Backtrader 回测并打印真值答案(附录J (https://arxiv.org/html/2608.11232#A10.SS0.SSS0.Px3))。验证代码接受一个环境变量(MCQ\_SEED),用于参数化股票代码、日期范围和佣金率等输入,从而支持种子控制的干扰项生成。流水线在子进程中执行该代码,超时时间为 120 秒;失败则丢弃问题。生成器提示中包含先前尝试及其结果的记录,使 LLM 能够在一次挖掘会话中从自身错误中学习。

#### 2.2.3 MCQ 转换
验证后的问题被转换为四选项多项选择题。三个干扰项通过使用扰动种子值重新运行验证代码生成,并收集唯一答案值;如果少于四个,则使用乘法抖动(±\pm10%,±\pm20%)来填补空白。选项顺序以确定性方式洗牌。一个合理性检查验证所有四个选项均为非空,且真值答案恰好映射到 A/B/C/D 中的一个。

##### 干扰项校准。
由于干扰项是通过对正确值进行乘法扰动形成的(比例因子从0.70.7到1.31.3,带有小随机抖动),每个干扰项都与正确答案处于同一数量级。在20,00020\{,\}000个模拟项目中,干扰值距离正确值7%7\\%到33%33\\%(平均20%20\\%),最近的干扰项平均距离12.8%12.8\\%(中位数10.7%10.7\\%)。因此,粗略或数量级的排除是无效的:选择正确选项需要计算精确的数值,而不是估计大致大小。

#### 2.2.4 多阶段过滤

##### 阶段1:无工具求解器(若解决则丢弃)。
每个 MCQ 呈现给无工具求解器(Cursor SDK,禁用所有工具使用,并带有一个在任何工具调用时取消的运行时检查器)。如果求解器回答正确,则该问题被视为仅凭参数知识即可解决,予以丢弃。

##### 阶段2:工具增强型求解器(若解决则保留)。
幸存的问题被传递给具有完整代码执行权限的工具增强型求解器。如果它回答正确,则保留该问题:GPT\-5.4 过滤器无法无工具回答它,并且它被确认为合理。

##### 阶段3:人工审查。
两个求解器均未解决的问题将保存以供人工审查,以确定它们是真正困难还是格式错误。

#### 2.2.5 智能体后端和持久化
两个求解器

相似文章

QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准

Hugging Face Daily Papers

# 论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准 来源:[https://huggingface.co/papers/2604.15151](https://huggingface.co/papers/2604.15151) ## 摘要 QuantCode\-Bench 通过测试大语言模型能否将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估其生成可执行交易策略的能力。

AI-Trader:在实时金融市场中对自主智能体进行基准测试

Papers with Code Trending

本文介绍了 AI-Trader,这是首个用于评估大语言模型(LLMs)在美股、A股和加密货币等金融决策方面的全自动实时基准测试平台。研究指出,通用智能并不必然保证交易成功,并强调了在自主智能体中风险控制的重要性。

TradingAgents:多智能体 LLM 金融交易框架

Papers with Code Trending

本文介绍了 TradingAgents,这是一个多智能体 LLM 框架,通过模拟现实世界中的交易公司来提升股票交易表现。该框架利用执行分析和风险管理的专用智能体,在累计收益和夏普比率方面优于基线模型。

移动智能体评估中的 LLM 评判器基准测试

arXiv cs.AI

本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。