AgonAlpha:通过提示经济与可扩展智能体搜索实现自主Alpha发现
摘要
AgonAlpha是一个全新的自主Alpha发现系统,它在经过验证的研究产物中进行搜索,并采用具有否决权的对抗性审核器以及考虑待处理任务的预算分配机制。在WorldQuant BRAIN上的部署取得了高适应度与夏普比率,同时保留了完整的溯源信息。
arXiv:2608.11250v1 公告类型:新
摘要:语言模型可以提出许多看似合理的交易因子,但一个自主研究系统还必须分配其评估预算、验证自身证据,并保留每个候选因子的产生过程。我们提出了AgonAlpha,一种在冻结的研究产物——假设、可执行表达式、平台证据、理由和审核状态——上进行搜索的架构,而不仅仅是公式。据我们所知,AgonAlpha是首个将已验证产物搜索、具有重新执行和否决权的新鲜上下文对抗性审核器、以及考虑待处理任务的并行预算分配相结合的Alpha挖掘系统,并带有完整的公开证据追踪。在WorldQuant BRAIN上的独立部署在五个用户和六个模型后端上产生了SPECTACULAR级别的Alpha,适应度达到9.50,夏普比率达到3.48,同时保留每次提交从提示到表达式的完整溯源。
查看缓存全文
缓存时间: 2026/08/13 15:24
# AgonAlpha:基于提示经济与可扩展智能体搜索的自主Alpha发现 来源:https://arxiv.org/html/2608.11250 Weicheng Ye1,\*,‡, Youran Sun2,\*, Xingyu Ren1,\*, Shunyao Yu1, Chugang Yi2, Haizhao Yang2,3,† 1香港中文大学物理系,中国香港特别行政区 2马里兰大学数学系,马里兰大学帕克分校,美国马里兰州 3马里兰大学计算机科学系,马里兰大学帕克分校,美国马里兰州 ###### 摘要 语言模型可以提出许多看起来合理的交易因子,但一个自主研究系统还必须分配其评估预算、核验自身证据,并保留每个候选因子是如何产生的。我们提出AgonAlpha,一种在冻结的研究工件(frozen research artifacts)——假设、可执行表达式、平台证据、理性依据和评审状态——而非仅公式之上进行搜索的架构。据我们所知,AgonAlpha是首个将经核验的工件搜索、具有重新执行与否决权的新鲜上下文对抗式评审器,以及感知进行中任务的并行预算分配这三者结合,并附带完整公开证据链的alpha挖掘系统。在WorldQuant BRAIN上的独立部署,横跨五个用户和六个模型后端,产生了SPECTACULAR级别的alpha,Fitness最高达到9.50,Sharpe最高达到3.48,同时每个提交都保留了从提示到表达式的完整来源追溯。 11footnotetext:共同贡献。22footnotetext:[email protected]。33footnotetext:[email protected]。 ###### 目录 1. [1 引言](https://arxiv.org/html/2608.11250#S1) 2. [2 相关工作](https://arxiv.org/html/2608.11250#S2) 1. [2.1 轴一:搜索单元](https://arxiv.org/html/2608.11250#S2.SS1) 2. [2.2 轴二:验证机制](https://arxiv.org/html/2608.11250#S2.SS2) 3. [2.3 轴三:预算分配](https://arxiv.org/html/2608.11250#S2.SS3) 3. [3 Agon哲学的极简实现](https://arxiv.org/html/2608.11250#S3) 4. [4 AgonAlpha系统](https://arxiv.org/html/2608.11250#S4) 1. [4.1 问题形式化](https://arxiv.org/html/2608.11250#S4.SS1) 2. [4.2 双角色契约](https://arxiv.org/html/2608.11250#S4.SS2) 3. [4.3 对抗性验证协议](https://arxiv.org/html/2608.11250#S4.SS3) 4. [4.4 两级预算分配](https://arxiv.org/html/2608.11250#S4.SS4) 5. [5 评估与工件发布](https://arxiv.org/html/2608.11250#S5) 1. [5.1 协议](https://arxiv.org/html/2608.11250#S5.SS1) 2. [5.2 概览](https://arxiv.org/html/2608.11250#S5.SS2) 3. [5.3 评审干预(Q2)](https://arxiv.org/html/2608.11250#S5.SS3) 4. [5.4 分配与并发(Q3)](https://arxiv.org/html/2608.11250#S5.SS4) 5. [5.5 工件完整性](https://arxiv.org/html/2608.11250#S5.SS5) 6. [6 讨论与局限](https://arxiv.org/html/2608.11250#S6) 7. [7 结论](https://arxiv.org/html/2608.11250#S7) 8. [参考文献](https://arxiv.org/html/2608.11250#bib) 9. [部署总结](https://arxiv.org/html/2608.11250#Sx1) 10. [代表性示例运行](https://arxiv.org/html/2608.11250#Sx2) 1. [评审发现了什么](https://arxiv.org/html/2608.11250#Sx2.SSx1) 2. [Alpha构造与经济解释](https://arxiv.org/html/2608.11250#Sx2.SSx2) 3. [逐节点详细说明](https://arxiv.org/html/2608.11250#Sx2.SSx3) 4. [这次典型运行展示了什么](https://arxiv.org/html/2608.11250#Sx2.SSx4) 5. [不同日历制度下的行为](https://arxiv.org/html/2608.11250#Sx2.SSx5) 1. [证据索引](https://arxiv.org/html/2608.11250#Sx2.SSx6) 6. [工件完整性](https://arxiv.org/html/2608.11250#Sx2.SSx7) ## 1 引言 随着智能体工作流的日益普及,自主alpha发现不再仅仅是由大语言模型(LLM)生成看似合理的公式,而是还要设计一个完整的评估与自我改进系统。这一系统不能仅限于系统化且一致地生成看似合理的alpha:它还必须决定哪些alpha想法家族值得获得有限的、昂贵的平台评估机会,确保记录的证据与所评估的候选对象一致,并在每次运行后保留足够的状态以可靠地重建结果。AlphaBench表明,尽管语言模型在生成可执行因子方面相对有效,但在零样本因子排序上仍然存在困难(Luo等,2026 (https://arxiv.org/html/2608.11250#bib.bib22))。与此同时,已发表异象的表现也随时间显著减弱。在Chen和Welch分析的2005年后非微型股样本中,中位月度收益率仅为约7个基点——这种效应量小到可以用统计偶然性或适度交易成本来解释(Chen和Welch,2026 (https://arxiv.org/html/2608.11250#bib.bib30))。此外,对30篇基于LLM的交易论文的系统性综述揭示了一个反复出现的研究实践缺口:虽然模型架构经常被详细描述,但诸如时点数据控制、训练-测试划分、样本外评估、交易成本、换手率假设、执行细节和工件可用性等关键方面却经常被低度报告(Yao和Zheng,2026 (https://arxiv.org/html/2608.11250#bib.bib3))。这些发现共同将核心挑战定位在自动化alpha发现循环的层面:保留证据、在相互竞争的思路之间分配昂贵的评估、以及将提案与验证分离。 参考图1 图1:LLM驱动的alpha挖掘的两种范式。*左*:公式级搜索,带自我评分和封闭轨迹。*右*:AgonAlpha在受新鲜上下文评审且由感知进行中任务的调度器(在10个并发工作器下验证)管理的研究工件上进行搜索。 为此,我们采用*工件级*发现;与先前许多*公式级*的工作相比,有四个独特的架构选择,如图1 (https://arxiv.org/html/2608.11250#S1.F1) 所示。 - **搜索单元。**现有系统通常将公式视为发现的基本单元。然而,单独的公式并不能保留激发它的假设、被探索后又被拒绝的替代方向,或在此过程中被解决的异议。我们反过来将发现视为研究决策的谱系,保留理解候选因子为何被生成以及如何演化所需的上下文。 - **验证机制。**现有系统通常依赖自我评估程序或标量性能阈值。虽然这些机制在候选排序方面有效,但它们并不能独立验证所记录的证据是否与所评估的候选对象一致。我们引入显式的验证程序,以审计生成的候选对象、评估记录和报告结果之间的对应关系。 - **资源分配。**现有系统通常按照固定计划分配搜索预算。然而,当外部平台评估需要大量时间且多个研究方向并发推进时,静态分配无法自适应地将资源重新导向有前景的研究谱系,也无法考虑已在进行的评估。我们转而将评估预算分配视为一个主动决策问题,使系统能够在协调进行中实验的同时优先考虑有前景的方向。 - **证据保留。**现有系统往往提供不完整的证据链。对30篇基于LLM的交易论文的审计显示,解释报告结果所需的关键执行和评估细节,其可获得性往往低于智能体架构本身描述的可得性(Yao和Zheng,2026 (https://arxiv.org/html/2608.11250#bib.bib3))。因此,我们强调保留完整的研究工件和执行历史,使结果能够被复现和独立评估。 这些差异共同凸显了一个更广泛的区别:它们不仅仅是单个因子生成方法的局限,而是构建一个完全自主的发现系统所必需的缺失接口。AgonAlpha通过三个协同组件实现这些接口:一个提议者(proposer)、一个新鲜上下文评审器(fresh-context reviewer)和一个感知进行中任务的调度器(pending-aware scheduler)。提议者将每个候选提交为带证据的工件;评审器独立检查该工件,可以重新运行相关的平台评估,并可拒绝无证据支持或伪造的主张;调度器在考虑已在进行的评估的同时,将每次后续调用分配给一个研究谱系。这种架构遵循*Agon哲学*和提示经济原则(Sun等,2026a (https://arxiv.org/html/2608.11250#bib.bib1), b (https://arxiv.org/html/2608.11250#bib.bib2))。五位共同作者在WorldQuant BRAIN上使用多个模型后端部署了AgonAlpha,产生了60个提交,其中17个获得了SPECTACULAR等级;观测到的最佳Fitness和Sharpe比率分别为9.50和3.48。我们对五个代表性案例进行了详细分析,并发布了所有60个提交的提示词、决策、评审、平台证据和因子表达式,完整集合见补充材料。 在系统设计之上,评估设计本身就是一个关键的系统考虑因素。现有方法(包括AlphaForge、AlphaJungle和FactorMiner)即使引入时间或跨市场保留集,也通过作者控制的学术流程来评估生成的因子(Shi等,2025 (https://arxiv.org/html/2608.11250#bib.bib9), 2026 (https://arxiv.org/html/2608.11250#bib.bib4);Wang等,2026 (https://arxiv.org/html/2608.11250#bib.bib5))。这些协议改善了发现数据与评估数据之间的分离,但评估者仍然是被设计系统的一部分。我们的方法转而采用WorldQuant BRAIN作为外部评估环境:该平台独立决定数据、模拟规则、指标、提交约束和最终得分,并为合格的研究顾问提供激励机制(WorldQuant,2026 (https://arxiv.org/html/2608.11250#bib.bib32))。因此,我们的结果不仅衡量因子发现能力,还衡量自主研究系统在固定且外部治理的评估制度下运行的能力。 **贡献。** - **C1 — 一种可审计alpha发现的集成架构。**据我们所知,AgonAlpha是首个将经核验的工件搜索、对抗式评审权限、感知进行中任务的并行预算分配以及完整公开证据链相结合的alpha挖掘系统。其紧凑实现通过两个角色和101行角色提示词,应用了Agon的六项原则——提示经济、最小提示、面向未来、零代码、跨学科、大规模并行(Sun等,2026a (https://arxiv.org/html/2608.11250#bib.bib1), b (https://arxiv.org/html/2608.11250#bib.bib2))。 - **C2 — 在带证据的工件上进行轨迹级搜索。**搜索单元是一个冻结的研究工件,包含假设、可执行表达式、平台证据、经济理性依据和评审状态。因此,调度器跨研究谱系分配工作,而非在孤立的公式编辑之间分配。 - **C3 — 具有重新执行和否决权的对抗式评审。**评审器被独立路由并以新鲜上下文调用,可以重新运行平台证据,当核实到伪造时可将调度器奖励设为零。其他风险发现则作为可检查的警告附加在工件上。 - **C4 — 感知进行中任务的并行预算分配。**跨谱系的感知进行中任务的MCTS调度器结合了渐进拓宽、百分位奖励、背压和根回退,使在途工作影响后续分配。在每个流水线内,一场减半锦标赛将模拟集中在幸存的候选上(§4.4 (https://arxiv.org/html/2608.11250#S4.SS4))。 - **C5 — 轨迹完整的多用户部署验证。**五个用户和多个模型后端产生了60个外部评分的提交,包括17个SPECTACULAR alpha,Fitness达到9.50。我们发布了每一个提示词、搜索决策、平台记录、评审和可执行表达式。 ## 2 相关工作 ### 2.1 轴一:搜索单元 大多数alpha挖掘智能体在公式上进行搜索。AlphaJungle将蒙特卡洛树搜索(MCTS)应用于公式表达式树,使用一个LLM来生成并对候选进行自我评分(Shi等,2026 (https://arxiv.org/html/2608.11250#bib.bib4))。它问的是*在哪里添加下一个运算符*;我们问的是*哪个谱系应该获得下一个预算*。QuantaAlpha在固定五轮计划下将轨迹作为遗传物质进行演化;我们的工件是证据单元——冻结的、经过对抗性门控、并由UCB预算分配的(Han等,2026 (https://arxiv.org/html/2608.11250#bib.bib6))。FAMA线性地串联经验,并在其自身评估中报告了幻觉(Li等,2024 (https://arxiv.org/html/2608.11250#bib.bib10)),这直接推动了C3的提出。 ### 2.2 轴二:验证机制 FactorMiner(Wang等,2026 (https://arxiv.org/html/2608.11250#bib.bib5))是最近的竞争者,具有相同的角色数量,但组织原则相反。其角色按功能划分(生成器加确定性工具评估);我们的角色按对抗性划分(提议者加攻击者)。其Ralph Loop是一个线性循环,没有树、没有UCB、也没有跨谱系分配。其验证是一个*工具*——对IC和相关性的确定性阈值——而我们的验证是一个*权威*,拥有重跑和否决权。FactorMiner发布了其因子库,但代码和提示词保持封闭。FactorMAD的辩论是合作性的,没有否决权,录取回到确定性截止线(FactorMAD,2025 (https://arxiv.org/html/2608.11250#bib.bib24))。Agora的小组分散了权力,因此没有单一的验证者同时拥有重跑和否决权。其自己的分析得出结论,增加智能体仅仅是将自我确认的失败转移了位置,而非解决它(Agora,2026 (https://arxiv.org/html/2608.11250#bib.bib15))。CogAlpha部署了21个智能体,每次运行约500个H100小时,采用同模型质量控制且提示词不公开(CogAlpha,2025 (https://arxiv.org/html/2608.11250#bib.bib14))。Beyond Prompting的固定阈值门控在公开环境中失败(Huang和Fan,2026 (https://arxiv.org/html/2608.11250#bib.bib18)),AlphaCrafter记录回测到实盘的断崖效应(AlphaCrafter,2026 (https://arxiv.org/html/2608.11250#bib.bib21);ATLAS,2025 (https://arxiv.org/html/2608.11250#bib.bib31))。AlphaBench不是一个竞争对手。其关于LLM因子评估近乎随机的发现,为C3提供了最强的已发表动机(Luo等,2026 (https://arxiv.org/html/2608.11250#bib.bib22))。 ### 2.3 轴三:预算分配 R&D-Agent-Quant在双臂老虎机(是臂而非树节点,且没有在途工作的概念)下交替进行因子开发和模型开发(Li等,2025 (https://arxiv.org/html/2608.11250#bib.bib7))。AlphaGen报告了探索停滞,而QF-REINFORCE的算法层补丁使其CSI500 RankIC仍低于AlphaGen,却没有解释这一差距(Yu等,2023 (https://arxiv.org/html/2608.11250#bib.bib11);Zhao等,2025 (https://arxiv.org/html/2608.11250#bib.bib12))。AlphaForge则在一个冻结的因子池上运行硬编码流水线(Shi等,2025 (https://arxiv.org/html/2608.11250#bib.bib9))。QuantEvolver通过GRPO将经验编码到模型权重中来解决同一问题(Zhang等,2026 (https://arxiv.org/html/2608.11250#bib.bib23))。AgonAlpha则是在推理时进行搜索,这是平台用户可用的唯一选项。
相似文章
AI交易中的Alpha奇点:通过智能体间自我进化实现市场推理的涌现
本文介绍了密封联合搜索(SJS)和Agora系统,其中五个专业化的LLM智能体类协作进化Alpha因子。在91天的CSI 1000留存集上,Agora实现了投资组合夏普比率+1.87,显著优于基线,并且发现的指标表现为系统的涌现属性。
XALPHA:一种记忆驱动的AI量化研究员,用于从假设到代码的Alpha发现
XAlpha引入了一种记忆驱动的AI量化研究员,它整合金融知识和发现反馈,自动完成从假设到代码的Alpha发现全流程,在沪深300上取得了更强的性能。
用于自动神经算子发现的智能体AI科学社区
本文提出了一种由虚拟实验室组成的智能体AI科学社区,能够自主发现用于偏微分方程问题的神经算子架构。通过引用经济体系下的LLM规划器、数值工作者和评审者,该系统生成了高精度的混合架构,结果表明算子家族之间不存在普遍优胜者。
@RitOnchain: https://x.com/RitOnchain/status/2069693848478269730
本文详细介绍了一家系统性基金如何用基于RAG的LLM代理架构取代其传统NLP流水线,从非结构化数据中实现了alpha生成能力提升340%。文中引用了近期研究(Alpha-GPT 2.0、FinCon、FinAgent),表明在自动化因子发现和交易性能方面取得了显著进步。
AutoResearchClaw:自我强化的自主研究与人机协作
AutoResearchClaw是一个多智能体自主研究系统,通过结构化辩论、自我修复执行和人机协作来改进科学发现,在ARC-Bench基准上比之前的系统高出54.7%。