AI交易中的Alpha奇点:通过智能体间自我进化实现市场推理的涌现
摘要
本文介绍了密封联合搜索(SJS)和Agora系统,其中五个专业化的LLM智能体类协作进化Alpha因子。在91天的CSI 1000留存集上,Agora实现了投资组合夏普比率+1.87,显著优于基线,并且发现的指标表现为系统的涌现属性。
arXiv:2606.29194v1 公告类型:新
摘要:自动化Alpha挖掘保持评分函数固定,并对其改变搜索算法。收敛于固定评分器的搜索会过度拟合评分器无法惩罚的任何内容,这是样本外泛化差距的主要原因。我们将评分函数视为与Alpha因子并列的搜索产物,并研究哪些条件使得这种联合搜索可行。密封联合搜索(SJS)是一个框架:一组关于自主发现系统中信息流的结构条件,这些条件防止联合搜索崩溃为自我确认,同时保持评估器密封。条件涵盖角色分解、类型化角色间通信、来源密封读取、版本化存储和底层局部提升。Agora对SJS进行了实证测试:五个LLM智能体类通过三个通道进行通信,演化出八个技能库,其中Alpha库基于AlphaGen算子构建。三个评估器撰写报告,汇总成一份简报,保留分歧而非投票。我们在CSI 1000上运行Agora 100轮,并在一个对所有LLM输入密封的2026年91天留存集上进行评估。Agora的留存夏普比率为+1.87;最佳基线在有利种子下为+1.334,跨种子均值为-0.755。将Agora的两个指标预加载到冻结库消融实验中,仅恢复了+2.25夏普差距中的+0.40,而在不演化库的情况下添加PPO则扩大了差距。这两个指标是涌现出来的,而非设计出来的。注意事项:单种子运行,信号集中在空头端,旨在用于多空策略。
查看缓存全文
缓存时间: 2026/06/30 05:33
# 通过智能体间自我进化实现涌现性市场推理 来源:https://arxiv.org/html/2606.29194 ## AI交易的阿尔法奇点:通过智能体间自我进化实现涌现性市场推理 Siyuan Liu Panda AI [email protected] Bingjun Liu Panda AI [email protected] ###### 摘要 自动阿尔法挖掘将评分函数固定,并在此之上变化搜索算法。若搜索算法针对固定评分者收敛,则会对评分者无法惩罚的任何偏差进行过拟合——我们认为这是样本外泛化差距的主要原因。本文将评分函数视为与阿尔法因子并列的搜索产物,并研究何种条件能使这种联合搜索成为可接受的方案。 **密封联合搜索(SJS)** 是我们提出的框架:一组关于自主发现系统内部信息流的结构性条件,这些条件能够防止联合搜索坍缩为自我确认,同时保持外部评估器处于密封状态。这些条件涵盖:角色分解、角色间类型化通信、来源密封的读取、持久的版本化产物存储,以及基于底层本地的晋升规则。 **Agora** 是我们为实证检验 SJS 而构建的系统:五个角色专业化的LLM智能体类,通过三个类型化通道进行通信,共同演化八个技能库,其中阿尔法侧库基于 AlphaGen 算子词汇表构建。三个独立的评估器实例撰写叙事报告,由编排器汇总成一份简报,因此裁定过程会保留分歧而非将其坍缩为投票。我们在 CSI 1000 上运行 Agora 100轮外部循环,并在一个对所有LLM输入密封的 91 天 2026 年保留集上评估。Agora 在保留集上达到投资组合夏普比率 +1.87;最强基线在有利的随机种子下达到 +1.334,跨种子的均值则为 −0.755。将 Agora 发现的两个指标预加载到冻结库消融实验中,仅能恢复 +2.25 夏普差距中的 +0.40;而添加 PPO 但不进行库演化则使差距恶化。这两个指标更像是系统的涌现属性,而非设计的组件。两个注意事项:完整的 Agora 运行是单种子实验,且信号集中于空头侧,因此旨在用于多空部署。 ## 1 引言 自主发现问题具有一个共同的结构:搜索过程提出候选产物,评分函数对其进行排序,外部评估器在搜索从未接触过的数据上裁定结果。量化阿尔法挖掘就是一个例子。自主定理证明、自主程序合成和自主实验设计也是其他例子。在阿尔法挖掘中,寻找回报预测表达式的方法经历了三代演进:手工构建的因子模型(Fama–French [8,9]、动量 [13,4]、Alpha101 目录 [14]);符号回归与遗传编程 [16,34,53,6];以及将表达式树视为序列决策的基于RL的搜索 [51,35,29]。在这三代以及其它自主发现领域中,评分函数在设计时是固定的。搜索过程无法检测其自身目标是否已在训练段上过拟合,且任何报告出的增益都取决于一个没有参与者修订的超参数。鉴于 [2,10,15,22] 中记录的多重比较问题,这是一个严格的约束:当瓶颈在于目标的选择而非表达式的选择时,更好的搜索过程也无济于事。 将评分函数本身作为一个搜索产物来对待是一种应对方式。现有的自我演化系统 [40,23,32,12,21,52] 通过两种方式解决由此产生的坍缩:要么固定一个准则(从而继承其盲点),要么对每个提案都查询一个强外部评估器(并承担随之而来的样本成本和信息泄露成本)。这两种路径都未能解决联合搜索问题本身。 本文引入了第三种机制:**密封联合搜索(SJS)**。准则被搜索,外部评估器被密封,两者之间的连接由底层约束调节,任何参与的智能体都无法控制这些约束。SJS 是一组关于搜索过程的结构性条件,而非一个具体系统。五个条件是:F1 分解提案——提案者和裁定者是分离的角色,没有共享状态;F2 角色间类型化通信——角色之间没有自由形式的聊天;F3 来源密封的底层——每条记录都带有其数据段标签,读取按角色和内容类型过滤;F4 持久的版本化产物存储——角色拥有,具有内置/试用/接受/拒绝的状态机;以及 F5 基于底层本地的晋升规则——非自我判断且基于结果。一个边界条件是在运行前固定外部评估器,并使其对所有LLM输入不可访问。 为了实证验证 SJS,我们将其实例化为 **Agora**,这是一个 A2A LLM 系统,其中五个角色专业化的智能体类(九个具有隔离上下文的客户端)通过三个类型化通道通信,并在一个密封的底层上共同演化八个技能库。底层将每个智能体的输出路由到一个共享类型化记录中,后续智能体在读取时看不到其他智能体的上下文。在此实现中,裁定是协商过程:独立的评估器实例产生叙事报告,底层将其汇总而非简化为单一投票,因此反对意见会作为证据进入下一轮。阿尔法侧的库(算子、RL网络、RL算法、奖励)基于 AlphaGen [51] 构建;指标、主题、评分标准和元评分标准库则播种了故意稀疏的内置条目。晋升基于训练段夏普比率且 |ρ| > 0.3。2026 年保留集仅在运行完成后加载一次,并对所有LLM输入密封。核心研究问题是 SJS 实现下保留集性能的分解:样本外增益中有多少可归因于(a)库演化,(b)A2A 分解本身,(c)孤立LLM的能力,以及(d)底层RL或符号搜索机制。我们通过在 CSI 1000 上运行 100 轮 Agora 并与七个基线(遗传编程、纯PPO、单LLM一次性、迭代单LLM、Alpha101、冻结库消融和随机搜索)加上三个 Agora 内部的消融实验来回答这个问题。 #### 贡献。 - **密封联合搜索(SJS)**,一种在密封外部评估器下对信号和评分函数进行联合搜索的方法论框架。该框架包含五个关于搜索过程信息流的结构性条件(F1–F5)以及一个关于评估器的边界条件。SJS 独立于任何特定的优化器、语言模型或算子语言。 - **Agora**,SJS 的一个实例化,作为 A2A LLM 系统,满足 F1–F5,包含五个角色专业化的智能体类、三个类型化通道、八个技能库以及一个基于训练段夏普比率的经验性晋升规则。Agora 在密封的 2026 年 91 天 CSI 1000 保留集上评估。 - **关于 SJS 的实证证据**,通过 Agora 展示。Agora 在保留集上达到投资组合夏普比率 +1.87,在点估计上优于七个基线。在 100 轮中,演化恰好出现在八个技能库中的一个(指标库),产生了两项晋升条目,系统并未被设计来产生这些条目。这两项指标都不是由任何单个智能体产生的:它们是跨轮次的聚合晋升证据涌现出来的。消融实验分离出联合 F4+F5 机制(持久化+底层本地晋升)的总贡献上限为 +2.25 夏普单位,其中两个LLM发现的指标的静态价值贡献为 +0.40。将 PPO 中继添加到冻结系统中是有害的,这表明搜索过程的不对称升级而不协同演化评分函数会产生反效果。 - **开源发布**。我们发布 Agora 的实现、所有七个基线配置(在通用评估框架下)、泄露审计报告以及八个技能库的每轮注册表快照。 ## 2 相关工作 #### 符号阿尔法生成。 三代方法对 OHLCV 变量上的算术表达式空间进行了搜索,寻找与未来回报相关的表达式。手工构建的公式 [14,8,9,4,13] 早于任何自动化搜索;AutoAlpha [53] 和 AlphaEvolve [6] 引入了算子树上的演化搜索 [16,34];AlphaGen [51] 用可掩码 PPO 策略 [35,31] 取代了遗传引擎。深度符号回归 [29] 形成了符号搜索中的一条并行路线。在这些方法中,适应度函数(通常是对未来回报的秩IC)在设计时是固定的,只有对表达式树的搜索过程发生变化。我们的基线 B1(AlphaGen 参考的 gplearn 改编版本)和 B2(AlphaGen 纯 PPO)来自最近两代。 [10,2] 中记录的多重比较问题促成了我们在第5节(https://arxiv.org/html/2606.29194#S5)中采用的保守归因策略。 #### 金融领域的LLM代码生成。 最近的工作提示语言模型生成阿尔法表达式或交易代码,这建立在通用代码生成文献 [5,38,3,27,1] 和金融调优模型 [44,47] 的基础上。FinMem [50] 在单个智能体之上叠加了结构化记忆,TradingAgents [46] 围绕交易任务安排了多个LLM角色。这些系统保持评分函数固定,并使用LLM来编写更好的表达式。我们包含了这种设置的两个最简单的变体:单LLM一次性(B3)和单LLM基于IC反馈迭代(B4)。Agora 与所有这些不同:它将评分函数本身视为一个搜索产物,受经验性晋升规则约束,而不是LLM被要求优化的固定目标。 #### 自我改进的LLM智能体。 在金融领域之外,一些系统允许LLM编辑自己的工具集。Voyager 构建了一个 Minecraft 技能库 [40],Eureka 编写RL奖励函数 [23],ADAS 搜索智能体设计 [12],FunSearch 发现数学构造 [32],AI Scientist 运行端到端研究循环 [21],STaR [52] 从模型自身的输出中引导推理链。推理和自校正构建块 [48,49,42,36,24] 以及工具使用机制 [33,41] 被分别研究。Agora 采用了基本形状(LLM提出Python代码,系统沙箱化并验证,接受的代码加入运行时),并添加了阿尔法发现特有的两个元素:一个密封的评估底层,区分用于演化指标的数据段和用于评估指标的数据段;以及一个经验性晋升规则,只有当候选指标的预测与实际训练夏普比率相关时才接受它。 #### 多智能体和智能体间LLM系统。 有几个框架协调多个LLM实例完成共享任务:MetaGPT 建模了软件开发层级 [11],AutoGen 提供了一个基于通用对话的框架 [45],CAMEL [18] 和 ChatDev [30] 使用角色扮演对话,Generative Agents [28] 展示了共享记忆上的涌现动态。AgentBench [20] 评估角色专业化智能体在一系列任务上的表现,能力调查 [19] 对设计空间进行了分类。这些系统中大多数协调底层是一个聊天历史,参与智能体可以直接读取。我们使用术语“智能体间(A2A)”来指代更窄的设置:每个智能体在隔离上下文(自己的客户端、消息历史和系统提示)上运行,所有跨智能体信息被强制通过一个智能体无法控制的类型化底层。Agora 在这种意义上是 A2A:LLM Wiki 和定向咨询包是带有角色作用域读取过滤器的类型化通道,没有智能体可以读取其他智能体的完整上下文。通过这种隔离,底层在通道级别而非指令级别过滤保留段信息;共享历史的多智能体设计无法强制执行这一约束。 #### 统计推断与样本外评估。 数据泄露和样本外评估文献早于LLM智能体文献,并提供了我们使用的推断工具:用于序列相关日收益的 Newey–West HAC 标准误 [26],[43] 的现实检查和数据窥探框架,[7] 的预测准确性检验,以及 [15] 的泄露分类方法 [15
相似文章
AgonAlpha:通过提示经济与可扩展智能体搜索实现自主Alpha发现
AgonAlpha是一个全新的自主Alpha发现系统,它在经过验证的研究产物中进行搜索,并采用具有否决权的对抗性审核器以及考虑待处理任务的预算分配机制。在WorldQuant BRAIN上的部署取得了高适应度与夏普比率,同时保留了完整的溯源信息。
AQuA:递归自我改进的量化交易研究智能体
AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。
@RitOnchain: https://x.com/RitOnchain/status/2069693848478269730
本文详细介绍了一家系统性基金如何用基于RAG的LLM代理架构取代其传统NLP流水线,从非结构化数据中实现了alpha生成能力提升340%。文中引用了近期研究(Alpha-GPT 2.0、FinCon、FinAgent),表明在自动化因子发现和交易性能方面取得了显著进步。
AlphaCrafter:一种用于截面量化交易的全栈多智能体框架
AlphaCrafter 是一个用于截面量化交易的全栈多智能体框架,它利用专门的智能体进行因子挖掘、筛选和交易,以适应不断变化的市场状况。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2054201045346287766
文章探讨了 Sakana AI 和 Meta 关于自我改进型 AI 智能体的最新研究,具体涉及达尔文-哥德尔机器(Darwin-Gödel Machine)和超智能体(Hyperagents),它们能够自主重写自身代码和基础设施以提升性能,且无需人工干预。