QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准
摘要
# 论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准 来源:[https://huggingface.co/papers/2604.15151](https://huggingface.co/papers/2604.15151) ## 摘要 QuantCode\-Bench 通过测试大语言模型能否将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估其生成可执行交易策略的能力。
查看缓存全文
缓存时间: 2026/04/21 07:21
论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准
来源:https://huggingface.co/papers/2604.15151
摘要
QuantCode-Bench 通过测试模型将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估大语言模型生成可执行交易策略的能力。
大语言模型(https://huggingface.co/papers?q=Large%20language%20models)在通用编程任务上表现强劲,但其生成可执行算法交易(https://huggingface.co/papers?q=algorithmic%20trading)策略的能力仍鲜有人探究。与常规代码基准不同,交易策略生成要求同时掌握领域专属的金融逻辑(https://huggingface.co/papers?q=financial%20logic)、熟悉专用 API,并产出不仅语法正确、还能在历史数据上真实下单的代码。本文提出 QuantCode-Bench,用于系统评估现代 LLM 把英文文本描述转换成 Backtrader 框架(https://huggingface.co/papers?q=Backtrader%20framework)策略的能力。该基准包含 400 个难度各异的任务,来源涵盖 Reddit、TradingView、StackExchange、GitHub 及合成数据。评估采用多阶段流水线,依次检查语法正确性、回测成功执行、是否产生交易,并通过 LLM 裁判(https://huggingface.co/papers?q=LLM%20judge)衡量与任务描述的语义对齐(https://huggingface.co/papers?q=semantic%20alignment)。我们在两种设定下对比 SOTA 模型:单轮生成必须一次到位;多轮智能体可接收迭代反馈并自主修复错误。分析各阶段失败模式后发现,当前模型的主要瓶颈并非语法,而是交易逻辑的正确落地、API 的合理使用(https://huggingface.co/papers?q=API%20usage)以及对任务语义的遵循。结果表明,交易策略生成属于一类独特的领域特定代码生成(https://huggingface.co/papers?q=code%20generation)任务,其成功不仅依赖技术正确性,还需自然语言描述、金融逻辑与策略在数据上的可观测行为三者对齐。
查看 arXiv 页面(https://arxiv.org/abs/2604.15151)
查看 PDF(https://arxiv.org/pdf/2604.15151)
项目主页(https://limexailab.github.io/QuantCode-Bench/)
GitHub(https://github.com/LimexAILab/QuantCode-Bench)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.15151)
在 agent 中获取该论文:
hf papers read 2604.15151
尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型引用
在模型 README.md 中引用 arxiv.org/abs/2604.15151 即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集引用
在数据集 README.md 中引用 arxiv.org/abs/2604.15151 即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 引用
在 Space 中引用 arxiv.org/abs/2604.15151 即可在此页面显示链接。
收录该论文的合集 1
相似文章
FindStatBench:评估大语言模型在组合代码合成中的表现
FindStatBench是一个用于评估大语言模型在组合代码合成任务上的基准测试,源自一篇arXiv论文。
AI交易:评估大语言模型在技术市场分析中的表现
本文采用基准方法,评估了大语言模型在交易中进行技术市场分析的能力。
CSTutorBench:面向积木编程的小型语言模型辅导能力基准测试
CSTutorBench是一个基准测试,用于评估小型语言模型在积木编程环境中作为辅导员的性能,重点关注教学行为。初步结果显示,模型在较深层的辅导技能(如避免答案泄露)上表现不佳,而提示词修订能提升分数。
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件
本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。
超越智能体架构:基于LLM的交易系统中的执行假设与可重复性
本文综述并审计了基于LLM的交易研究中的执行现实性,提出了更清晰的报告标准以提升可重复性和评估可比性。