智能体交易:当LLM智能体遇上金融市场
摘要
本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。
arXiv:2605.19337v1 Announce Type: new
摘要:越来越多的研究探索如何将大语言模型(LLMs)嵌入交易系统,使其作为能够感知市场信息、检索上下文、推理决策、发出可交易行动并根据市场反馈进行适应的智能体。本文将基于LLM的交易智能体重构为专家系统决策流水线,并以协议编码快照的形式,呈现了一份针对截至2026-03-09筛选出的77项研究的面向审计的证据图谱。一个主要实证子集(n=19)满足行动输出加闭环评估的最低边界;其余58项研究作为背景和设计上下文保留。核心实证发现是协议不可比性:在主要子集中,仅有2/19的研究报告了可提取的时间一致分割协议,1/19报告了明确的交易成本模型,1/19记录了标的范围或幸存者处理,11/19报告了执行时序或语义,15/19被编码为R0,且没有研究达到R3可再现性。因此,我们将架构-能力-适应作为工作分析视角而非已验证的分类法,并将证据账本、可再现性审计和报告检查清单作为主要贡献。调查结果表明,架构实验正在快速扩展,而可比较的评估协议、执行语义和可再现性工件仍是该领域当前的瓶颈。
查看缓存全文
缓存时间: 2026/05/20 08:28
# 代理交易:当大语言模型代理遇见金融市场 来源:https://arxiv.org/html/2605.19337 ###### 摘要 大量研究探索如何将大语言模型嵌入交易系统,作为感知市场信息、检索上下文、推理决策、发出可执行交易动作并根据市场反馈进行自适应的代理。本文将基于大语言模型的交易代理重新定义为基于专家系统的决策流水线,并呈现了一份审计导向的证据图谱,涵盖截至2026年3月9日筛选的77篇纳入研究的协议编码快照。主要实证子集(n=19)满足“动作输出”加“闭环评估”的最低边界;其余58篇纳入研究作为背景和设计上下文保留。核心实证发现是协议不可比性:在主要子集中,仅2/19的研究报告了可提取的时间一致数据划分协议,1/19报告了明确的交易成本模型,1/19记录了样本空间或幸存者偏差处理,11/19报告了执行时机或语义,15/19被编码为R0,且没有研究达到R3可重复性。因此,我们将“架构-能力-适应”作为分析视角而非经过验证的分类法,并将证据账本、可重复性审计和报告清单作为主要贡献突出呈现。本综述表明,架构实验正在快速扩展,而可比较的评估协议、执行语义和可重复构件仍然是该领域当前的瓶颈。 ###### 关键词:大语言模型,交易代理,金融市场,代理型人工智能,证据图谱,可重复性 ††期刊:Expert Systems with Applications ## 1 引言 将大语言模型整合到金融交易中,标志着传统量化预测模型向更自主、更具代理能力的系统的重要转变。传统的量化金融方法通常采用黑箱机器学习模型,生成价格或收益预测,但不具备显式的推理链或自适应能力。相比之下,基于大语言模型的交易代理通常实现一个显式循环——感知市场信息、存储经验、推理决策、执行交易并从结果中学习(Zhang 等,2024 (https://arxiv.org/html/2605.19337#bib.bib49);Xiao 等,2024 (https://arxiv.org/html/2605.19337#bib.bib48);Yu 等,2024 (https://arxiv.org/html/2605.19337#bib.bib37))。并非每个用于金融的大语言模型系统都进入本综述的同一证据层级:我们的主要实证子集仅限于那些发出可交易动作并在闭环中评估这些动作的系统。 参见图1:交易系统的代理光谱。从左到右:预测模型(如 FinBERT、StockBERT)感知市场信息但缺乏决策能力;信号生成器(如 AlphaGen、FactorMiner)增加决策层但仍未执行;部分代理(如无执行的 FinVis-GPT)包含记忆但缺乏动作模块;交易代理(如 FinAgent、TradingAgents)闭合了感知-记忆-推理-动作循环;完整生态系统(如多代理市场)增加了适应与协调。对于本综述的主要实证子集,研究必须同时满足包含边界所示的最低标准:动作输出和闭环评估。位于该边界左侧的研究可能为背景讨论提供信息,但不纳入主要、协议报告或可重复性统计。 本综述基于截至2026年3月9日筛选的77篇纳入研究形成的可审计证据账本。在该账本中,主要实证子集(n=19)保留给满足“动作输出 + 闭环评估”的研究,而其余58篇纳入研究提供设计和全景背景,不纳入协议或可重复性分母。在当前主要子集中,协议关键报告仍然稀少:仅2/19的研究披露了可提取的时间一致数据划分,1/19指定了交易成本模型,1/19记录了样本空间/幸存者偏差处理,11/19报告了执行时机或语义,15/19被编码为R0,0/19达到R3可重复性。这种代理架构可能提供实用优势,但并非自动获得,取决于仔细的仪器化和评估。 首先,基于大语言模型的代理可以生成人类可读的推理过程和交互轨迹;然而,此类文本并不能保证忠实于真实的内部决策过程。因此,有意义的可审计性依赖于可独立验证的、带时间戳的工具调用、数据快照和执行日志。其次,代理可以通过利用积累的经验在不断变化的市场条件下调整策略,但稳健性取决于仔细的验证和控制。第三,模块化设计使得感知、记忆和推理的专门化组件成为可能(见图2 (https://arxiv.org/html/2605.19337#S1.F2)),这使得系统更容易扩展、测试和随时间改进。由于交易是一个多步骤环境,幻觉事实或工具输出可能通过代理循环传播;我们将在第13节 (https://arxiv.org/html/2605.19337#S13) 中回到这些风险。 交易代理是金融决策支持流水线:它们通过检索、记忆、推理、执行约束和监督控制,将市场观察转化为可执行动作。因此,综述此类文献需要关于完整决策循环的证据:使用什么信息、动作如何形成、哪些保障措施约束执行、以及哪些构件允许专家审计。这一视角促使我们强调动作语义、协议报告和可重复证据,而非仅凭回测分数。 尽管基于大语言模型的交易系统迅速涌现,但文献缺乏一个共同的综述视角来区分代理边界、协议报告和架构角色。最近的综述和基准通常强调任务覆盖和模型级性能——例如,FinBen套件(Xie 等,2024 (https://arxiv.org/html/2605.19337#bib.bib1))、PIXIU(Xie 等,2023 (https://arxiv.org/html/2605.19337#bib.bib67))和 InvestorBench(Li 等,2025 (https://arxiv.org/html/2605.19337#bib.bib11)),以及金融特定的模型/工具工作如 FinGPT(Wang 等,2023a (https://arxiv.org/html/2605.19337#bib.bib7))。更广泛的关于金融和交易中 LLM 代理的综述(Ding 等,2024 (https://arxiv.org/html/2605.19337#bib.bib60);Dong 等,2025 (https://arxiv.org/html/2605.19337#bib.bib62))也很有用。虽然有价值,但这些工作通常不提供对代理如何感知市场数据、存储和检索信息、推理交易决策、在市场摩擦下执行动作或随时间调整行为进行系统性的阐述。 表1:选定的相关综述/基准与审计导向的综述重点对比。标准:Primary=中心组织关注点;Partial=定性讨论或仅针对部分工作;Background=主要作为支持性上下文出现;Not primary=超出工作主要综述目标。Arch:以架构为中心的组织(感知/记忆/推理/动作);Exec/Cost:明确的执行语义和交易成本建模;Map:结构化的证据映射表(≥20篇论文);R:可重复性层级评估(R0–R3)。 | 工作 | 类型 | 范围 | Arch | Exec/Cost | Map | R | |------|------|------|------|-----------|-----|-----| | 本综述 | 综述 | 交易代理 | Primary | Primary | Primary | Primary | | LLM-Agent Survey (Wang 等, 2024) | 综述 | 通用AI代理 | Primary | Partial | Not primary | Not primary | | Giglio-Kelly-Xiu (Giglio 等, 2022) | 综述 | 资产定价ML | Background | Partial | Not primary | Not primary | | FinBen (Xie 等, 2024) | 基准 | 金融任务 | Not primary | Not primary | Not primary | Not primary | | FinGPT (Wang 等, 2023a) | 模型/工具 | 金融NLP | Not primary | Not primary | Not primary | Not primary | | InvestorBench (Li 等, 2025) | 基准 | 交易任务 | Not primary | Partial | Not primary | Not primary | | LLM-Trading Survey (Ding 等, 2024) | 综述 | 交易代理 | Partial | Partial | Not primary | Not primary | | LLM-Finance Survey (Dong 等, 2025) | 综述 | 金融代理 | Partial | Partial | Not primary | Not primary | 注:比较标准反映了我们的审计聚焦视角。其他综述优先考虑不同的目标(例如模型基准测试、通用代理架构),在这些目标下我们的标准可能不适用。FinBen 和 InvestorBench 是基准而非综述;用“架构覆盖”评估它们可能不符合其设计目标。 ### 1.1 相关综述与定位 最近的一些综述考察了人工智能在交易和金融中的应用,但它们通常追求不同的综述目标,不同于本文使用的以架构为中心、关注协议的视角。我们将我们的工作与三类相关综述进行对比。 通用 LLM-Agent 综述。Wang 等人(2024 (https://arxiv.org/html/2605.19337#bib.bib152))广泛引用的一项通用综述,跨领域综述了基于 LLM 的自主代理,围绕代理构建、应用和评估进行组织。虽然对通用代理设计具有基础性意义,但该综述并未关注金融特定问题,如交易成本建模、市场摩擦约束或交易数据的时间结构。我们的工作通过聚焦交易来补充这一点,其中执行语义和成本假设是一等公民。 金融机器学习综述。Giglio 等人(2022 (https://arxiv.org/html/2605.19337#bib.bib153))综述了基于因子模型和机器学习的资产定价最新方法论贡献,围绕预期收益、因子、风险暴露、风险溢价、随机贴现因子、模型比较和 alpha 测试组织文献。其范围仍以资产定价估计和推断为中心,而非将预测映射为市场约束下可执行动作的代理问题。 任务导向的金融基准。FinBen 套件(Xie 等,2024 (https://arxiv.org/html/2605.19337#bib.bib1))、InvestorBench(Li 等,2025 (https://arxiv.org/html/2605.19337#bib.bib11))以及金融特定工作如 FinGPT(Wang 等,2023a (https://arxiv.org/html/2605.19337#bib.bib7))和 PIXIU(Xie 等,2023 (https://arxiv.org/html/2605.19337#bib.bib67))强调任务覆盖和模型级性能评估。这些基准对于在特定金融 NLP 或预测任务上比较模型很有价值,但通常不要求端到端的代理评估——即在市场摩擦和明确执行语义下的闭环动作生成。我们的综述特别关注闭合此循环的工作,将感知映射到执行。 鉴于代理交易系统的跨学科性质——整合了人工智能、量化金融、认知科学和经济学——这一差距尤其成问题。缺乏统一框架,研究人员和实践者在比较不同方法、识别重叠创新或系统探索交易代理的设计空间时面临困难。 ### 1.2 分类差距:为何现有框架存在开放缺口 尽管上述综述提供了有价值的覆盖,但它们有一个共同的局限:将交易代理视为通用 LLM-Agent 技术的应用或预测模型,而将执行视为事后考虑。这导致了系统性错误分类,模糊了关键设计选择并阻碍了比较分析。 局限1:执行作为隐含组件。现有框架通常将行动/执行视为推理的副产品,而非一等架构组件。例如,FinAgent(Zhang 等,2024 (https://arxiv.org/html/2605.19337#bib.bib49))在 Dong 等(2025 (https://arxiv.org/html/2605.19337#bib.bib62))中被归类为“多模态金融代理”,强调其感知模块,而弱化了其执行层——这是评估现实世界可部署性的关键组件。架构-能力-适应(A-C-A)视角将行动/执行作为核心架构维度,使订单映射、成本假设和延迟约束显式化(第6节 (https://arxiv.org/html/2605.19337#S6))。 局限2:架构-能力混为一谈。之前的综述常将机制(代理如何处理信息)与功能(代理完成什么任务)混为一谈。例如,AlphaAgent(Tang 等,2025 (https://arxiv.org/html/2605.19337#bib.bib29))是一个多代理 alpha 挖掘框架,其正则化探索机制——原创性强制执行、假设-因子对齐和复杂性控制——有助于对抗 alpha 衰减。A-C-A 视角区分了这些问题:相同的反应式架构可以支持 alpha 生成(高频信号)和执行(订单切片),而战略性架构则实现跨不同功能领域的投资组合管理(长期规划)(第7节 (https://arxiv.org/html/2605.19337#S7))。 局限3:适应作为实现细节。当前框架将学习和适应视为同质化实现细节,而非横切设计维度。TradingAgents(Xiao 等,2024 (https://arxiv.org/html/2605.19337#bib.bib48))被归类为“多代理框架”,而未区分其层级角色组织(架构)、分布式能力分配(能力)和基于反馈的适应(适应)。A-C-A 视角使适应层级显式化,从上下文学习(行为层面)到自我进化(结构层面),且每一层级都有不同的协议要求(第10节 (https://arxiv.org/html/2605.19337#S10))。 表2 (https://arxiv.org/html/2605.19337#S1.T2) 展示了三个代表性工作如何在 A-C-A 探索性分析视角下被重新解读,使架构区分比先前分类更为显式。附录 C (https://arxiv.org/html/2605.19337#A3) 提供了代表性论文的额外重分类注释,作为说明性材料而非外部验证研究。 表2:分类比较:现有框架如何对代表性工作进行分类与 A-C-A 探索性分析视角的对比。A-C-A 视角提供了架构粒度,补充而非驳斥了先前的分类;此表为说明性,未经外部验证。 | 工作 | 先前框架 | A-C-A 重分类 | |------|----------|--------------| | FinAgent (Zhang 等, 2024) | “多模态代理”(以感知为中心) | 架构:多模态感知 + 执行;能力:跨模态 Alpha;适应:上下文学习 | | AlphaAgent (Tang 等, 2025) | “多代理”(以组织为中心) | 架构:反思/战略混合推理;能力:基于代码的 Alpha 与验证反馈;适应:正则化探索对抗 Alpha 衰减 | | TradingAgents (Xiao 等, 2024) | “多代理框架”(以组织为中心) | 架构:层级角色协调;能力:分布式 Alpha + 投资组合 + 风险;适应:层级反馈 | 我们呈现一份关于基于 LLM 的交易代理的综述。
相似文章
TradingAgents:多智能体 LLM 金融交易框架
本文介绍了 TradingAgents,这是一个多智能体 LLM 框架,通过模拟现实世界中的交易公司来提升股票交易表现。该框架利用执行分析和风险管理的专用智能体,在累计收益和夏普比率方面优于基线模型。
超越智能体架构:基于LLM的交易系统中的执行假设与可重复性
本文综述并审计了基于LLM的交易研究中的执行现实性,提出了更清晰的报告标准以提升可重复性和评估可比性。
TauricResearch/TradingAgents
TradingAgents 是一个用于金融交易的开源多智能体LLM框架,支持多种LLM提供商,最近更新包括新模型和功能。
QuantAgent:基于价格驱动的多智能体大语言模型高频交易框架
QuantAgent 是一个专为高频交易设计的多智能体大语言模型框架,通过四个专业智能体(指标、形态、趋势、风险)基于短周期信号快速做出具有风险意识的交易决策。在对比比特币和纳斯达克期货在内的十种金融工具的零样本评估中,该框架在预测准确率和累计收益方面均优于现有的神经网络和规则驱动基线模型。
LLM交易代理中的表示特征与风险反馈对齐
本文研究了LLM代理在金融交易中的行为对齐与表示动态,介绍了TradeArena测试平台,并发现规划嵌入中存在可测量的故障前特征,这些特征能在多种前沿模型与压力条件下高精度预测回撤。