自主交易系统能否为其智能行为买单?
摘要
本文介绍了TradeLens,一个基于轨迹的诊断工具包,用于评估基于LLM的自主交易系统是否将其推理和工具使用成本转化为可衡量的增量利润,并分析了DeepSeek-V3.2和GLM-4.7等模型的失败模式。
arXiv:2607.10286v1 公告类型:新
摘要:大型语言模型(LLM)智能体越来越多地应用于交易系统,其中模型推理、工具使用和持续决策会产生成本,而这些成本预期能带来交易价值。现有评估通常报告性能指标,但很少考察自主可行性:即动态的LLM中介决策是否将其引发的成本转化为可衡量的增量利润。为了应用这一标准,我们引入了TradeLens,一个基于轨迹的诊断工具包,用于从交易记录、运行时轨迹和部署配置中评估自主交易系统。它重建交易轨迹,将利润和成本归因于可解释的证据,并诊断智能体是否以及为何为其智能行为买单。我们对骨干模型、资本规模、交易频率和系统架构进行了广泛分析,并进行了部署讨论。我们的结果表明,可行性取决于智能到利润的转化:模型表现出不同的失败模式,例如DeepSeek-V3.2的资产选择不佳和GLM-4.7的时机负收益,而资本规模、交易频率和架构仅通过放大或削弱决策归因的时机价值来起作用。这些发现将基于LLM的交易智能体的评估从以能力为中心的性能排名重新定义为基于轨迹的智能到利润转化诊断。我们的代码可在 https://anonymous.4open.science/r/TradeLens 获取。
查看缓存全文
缓存时间: 2026/07/14 04:20
# 自主交易系统能否为自身智能买单? 来源:https://arxiv.org/html/2607.10286 Qiqi Duan1∗\ast,Changlun Li2∗\ast,Chen Wang1∗\ast,Fan Zhang4,5,Mengxiang Wang1,Dayi Miao1,Peixian Ma2, Jiangpeng Yan3,Liyuan Chen3,Shuoling Liu3,Preslav Nakov4,Yuyu Luo1,2,Nan Tang1,2†\dagger 1HKUST\(GZ\)2Paradoox AI3E Fund Management Co., Ltd4MBZUAI5The University of Tokyo ∗\ast 同等贡献。†\dagger 通讯作者:[email protected] ###### 摘要 大型语言模型(LLM)智能体越来越多地被用于交易系统,其中模型推理、工具使用和持续决策会产生成本,而这些成本预计应能带来交易价值。现有的评估通常报告性能指标,但很少检验*代理可行性*(agentic viability):即动态的 LLM 中介决策是否能将其引发的成本转化为可衡量的增量利润。为了应用这一标准,我们引入了 **TradeLens**,这是一个基于追踪的诊断工具包,用于根据交易记录、运行时轨迹和部署配置来评估自主交易系统。它重建交易轨迹,将利润和成本归因于可解释的证据,并诊断代理是否以及为何为其自身智能买单。我们对骨干模型、资本规模、交易频率和系统架构进行了广泛分析,并进行了部署讨论。我们的结果表明,可行性取决于智能到利润的转化:不同模型表现出不同的失败模式,例如 DeepSeek-V3.2 在资产选择上表现不佳,GLM-4.7 在择时上为负,而资本规模、交易频率和架构仅通过放大或降低决策归因的择时价值来发挥作用。这些发现将基于 LLM 的交易代理的评估从以能力为中心的性能排名,重新定义为基于追踪的智能到利润转化诊断。我们的代码可在 https://anonymous.4open.science/r/TradeLens 获取。 ## 自主交易系统能否为自身智能买单? Qiqi Duan1∗\ast,Changlun Li2∗\ast,Chen Wang1∗\ast,Fan Zhang4,5,Mengxiang Wang1,Dayi Miao1,Peixian Ma2,Jiangpeng Yan3,Liyuan Chen3,Shuoling Liu3,Preslav Nakov4,Yuyu Luo1,2,Nan Tang1,2†\dagger 1HKUST\(GZ\)2Paradoox AI3E Fund Management Co., Ltd4MBZUAI5The University of Tokyo ∗\ast 同等贡献。†\dagger 通讯作者:[email protected] ## 1 引言 参见图注 图1:动机。一个盈利的自主交易系统仍可能无法创造有用的交易价值,而诊断“为什么”具有挑战性,因为回报和成本都源于相互交织的部署驱动因素。 凭借强大的通用推理能力 [Yu 等人 (2023a (https://arxiv.org/html/2607.10286#bib.bib54));Liu 等人 (2023a (https://arxiv.org/html/2607.10286#bib.bib1));Suma and Dauncey (2025 (https://arxiv.org/html/2607.10286#bib.bib16))] 以及对金融任务的日益适应 [Wu 等人 (2023 (https://arxiv.org/html/2607.10286#bib.bib47));Chen 等人 (2025a (https://arxiv.org/html/2607.10286#bib.bib5));Liu 等人 (2023b (https://arxiv.org/html/2607.10286#bib.bib29))],LLM 代理正从金融问答转向直接参与交易工作流。最近的系统将 LLM 用作交易副驾驶 [Fan 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib11));Yang 等人 (2024 (https://arxiv.org/html/2607.10286#bib.bib51))]、投资组合经理 [Zhao 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib60));Ko and Lee (2024 (https://arxiv.org/html/2607.10286#bib.bib21))] 以及配备外部工具的市场分析代理 [Han 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib18))]。 **观察。** 尽管结果令人鼓舞,但自主交易系统的评估方式仍存在关键空白。大多数现有研究报告*毛利润*或夏普比率等指标 [Li 等人 (2025b (https://arxiv.org/html/2607.10286#bib.bib27));Chen 等人 (2025b (https://arxiv.org/html/2607.10286#bib.bib6));Xie 等人 (2023 (https://arxiv.org/html/2607.10286#bib.bib49));Sharpe (1994 (https://arxiv.org/html/2607.10286#bib.bib64))]。虽然这些指标对衡量交易性能有用,但在部署方面并不完整:开发者不仅需要评估系统赚了多少利润,还需要了解利润来自哪里以及部署成本如何影响已实现利润。这一关切呼应了近期对成本感知的 LLM 评估,这些评估考虑了货币输出成本和低效推理计算 [Ero 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib9));Zellinger and Thomson (2025 (https://arxiv.org/html/2607.10286#bib.bib67));Wang 等人 (2025b (https://arxiv.org/html/2607.10286#bib.bib43));Zhang 等人 (2024 (https://arxiv.org/html/2607.10286#bib.bib57))]。然而,在自主交易中,成本有着更严格的含义:它是为 LLM 中介的智能所支付的价格,包括模型推理、工具使用、记忆检索和持续决策。除了在预算内运作 [Wang 等人 (2024 (https://arxiv.org/html/2607.10286#bib.bib80))],系统还应满足*代币经济要求* [Chen 等人 (2026 (https://arxiv.org/html/2607.10286#bib.bib81))]:产生足够的增量利润以证明其交易决策所消耗的智能是合理的。 **盲点。** 这一要求在评估自主交易系统时造成了利润端和成本端的双重盲点。如图1 (https://arxiv.org/html/2607.10286#S1.F1) 所示,一个代理系统可能获得 630 的毛利润,但扣除 250 的部署成本后,净利润降至 380;与此同时,一个简单的买入持有基线(无 LLM 推理或主动交易成本)在同一时期可能赚取 450。因此,当代理未能跑赢被动市场敞口时,毛利润可能夸大决策价值;当端到端成本吞噬已实现利润时,毛利润可能夸大可部署性。因此,我们问:**自主交易系统能否为自身智能买单,我们如何诊断 LLM 中介的决策是否将其引发的成本转化为增量交易价值?** **呼吁严格评估。** 回答这个问题需要识别 LLM 智能增加的价值及其产生的成本。图1 (https://arxiv.org/html/2607.10286#S1.F1) 下半部分所示的分解表明,利润和成本都由部署过程塑造。一个盈利的轨迹可能主要反映市场走势或有利的初始资产选择,而代理的动态决策贡献甚微甚至降低价值。相反,更高的推理、工具使用或执行成本并不一定是浪费的,如果它们产生了足够的主动利润。这使得严格评估对于诊断 LLM 中介的决策是否在经济上合理变得必要。 **基于追踪的诊断挑战。** 然而,执行这种诊断很困难,因为评估 LLM 中介决策所需的证据分散在不同的记录中。投资组合轨迹显示系统赚了什么,但不显示收益是来自被动敞口、初始配置,还是动态代理干预。运行时轨迹显示代理做了什么,包括模型调用、上下文处理、工具使用、重试和交易操作,但不显示这些活动是否改善了资产选择、择时或投资组合价值。部署成本进一步随模型选择、上下文长度、工具使用频率、交易节奏和执行行为而变化,使得单一成本代理不够。因此,挑战在于将智能到利润转化的诊断建立在来自交易结果、运行时轨迹和部署成本的异质证据之上。 **解决方案。** 为了应对这些挑战,我们提出了 **TradeLens**,一个基于追踪的诊断工具包,用于评估自主交易系统能否为自身智能买单。该工具包首先从投资组合记录、运行时轨迹和部署配置中重建投资流程,并将利润和成本归因于可解释的组成部分。基于这一证据,我们定义了两个可行性概念(第3节 (https://arxiv.org/html/2607.10286#S3)):*系统可行性*,询问部署的系统在端到端成本后是否能自给自足;*代理可行性*,询问动态的 LLM 中介决策是否创造了足够的主动价值来证明其决策引发的成本是合理的。然后,基于 LLM 的诊断代理根据观察到的交易轨迹生成基于证据的解释和策略级建议,并将这些诊断转化为可视化和文本报告(第4节 (https://arxiv.org/html/2607.10286#S4))。我们通过受控实验和从业者反馈评估 TradeLens,表明它揭示了被系统盈利能力隐藏的故障模式,并帮助用户评估可部署性和确定修订方向(第5节 (https://arxiv.org/html/2607.10286#S5))。总的来说,我们将自主交易系统的评估从以能力为中心重新定义为基于经济的评估。 总结来说,我们做出了三项贡献:(i) 我们将*利润-成本可行性*形式化为自主交易系统的一个基于追踪的评估问题,区分了整个部署系统是否能自给自足,以及 LLM 中介的决策是否证明了其引发的成本是合理的。(ii) 我们构建了 TradeLens,一个开源审计工具包,利用交易记录、运行时轨迹和部署配置来操作规程,并生成基于证据的诊断报告。(iii) 我们跨骨干模型、资本规模、交易频率和架构进行了实证可行性研究,并结合从业者反馈,展示了利润来源和智能成本如何共同决定可部署性。 ## 2 相关工作 ### 2.1 基于 LLM 的交易代理 基于 LLM 的交易代理已从金融分析和信号生成 [Wang 等人 (2025a (https://arxiv.org/html/2607.10286#bib.bib44));Xing (2024 (https://arxiv.org/html/2607.10286#bib.bib50))] 扩展到使用记忆、工具和多代理协调的决策流程 [Yu 等人 (2024 (https://arxiv.org/html/2607.10286#bib.bib55), 2023b (https://arxiv.org/html/2607.10286#bib.bib56));Xiao 等人 (2024 (https://arxiv.org/html/2607.10286#bib.bib48));Li 等人 (2025c (https://arxiv.org/html/2607.10286#bib.bib26))]。最近的工作还将评估更贴近实际交易环境,包括加密货币市场 [Li 等人 (2024 (https://arxiv.org/html/2607.10286#bib.bib24));Luo 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib32))、投资组合构建 [Guo 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib17));Zhao 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib60))、流式交互 [Li 等人 (2025a (https://arxiv.org/html/2607.10286#bib.bib28));Fan 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib11)),以及端到端研究平台 [Sun 等人 (2023 (https://arxiv.org/html/2607.10286#bib.bib40));Zhang 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib58))。在这些工作中,评估主要集中在能力或总交易表现上,而利润来源和经济可行性仍未得到充分探索。TradeLens 作为现有交易代理的诊断工具包,填补了这一空白,检查这些代理能否为自身智能买单。 ### 2.2 成本感知和基于追踪的 AI 评估 近期工作越来越多地将计算成本纳入模型评估。成本通过估计获得成功答案的货币成本 [Ero 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib9));Zellinger and Thomson (2025 (https://arxiv.org/html/2607.10286#bib.bib67));高效推理研究考察代理系统中的思维风格和冗余 [Wang 等人 (2025c (https://arxiv.org/html/2607.10286#bib.bib45));Lin 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib68));Wang 等人 (2025b (https://arxiv.org/html/2607.10286#bib.bib43));Zhang 等人 (2024 (https://arxiv.org/html/2607.10286#bib.bib57));其他工作推进了资源受限的评估 [Chen 等人 (2023 (https://arxiv.org/html/2607.10286#bib.bib4));Huang 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib19));Yang 等人 (2025b (https://arxiv.org/html/2607.10286#bib.bib52))。这些研究主要将成本视为资源效率变量。然而,对于 LLM 代理,成本也由决策过程本身引发,包括推理、工具使用、记忆访问和多步交互 [Cassano 等人 (2023 (https://arxiv.org/html/2607.10286#bib.bib82))。代币经济学进一步将这些活动框架化为在下游行动产生之前需要支付的代币和计算消耗 [Wang 等人 (2024 (https://arxiv.org/html/2607.10286#bib.bib80));Chen 等人 (2026 (https://arxiv.org/html/2607.10286#bib.bib81))。先前关于代理评估和诊断的工作表明,此类轨迹提供了超越最终任务结果的有用证据 [He 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib84));Ou 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib83))。在交易工作流中,我们在不同的环境中使用这种基于追踪的视角:代理活动可以与资源使用、交易操作和投资组合结果对齐,从而能够诊断决策引发的成本是否转化为交易价值。 ### 2.3 金融评估中的业绩归因 金融评估早已将原始回报与可解释的回报来源区分开来。风险调整指标如夏普比率 [Sharpe (1994 (https://arxiv.org/html/2607.10286#bib.bib64)) 和制度感知分析 [Ang and Timmermann (2012 (https://arxiv.org/html/2607.10286#bib.bib2)) 表明,投资组合结果可能反映波动性或市场状况,而非决策技能。经典的业绩归因将基准相对回报分解为配置、选择和交互效应 [Brinson 等人 (1986 (https://arxiv.org/html/2607.10286#bib.bib69), 1991 (https://arxiv.org/html/2607.10286#bib.bib70)),后来的工作使用归因来研究主动管理技能和动态配置行为 [Grinold and Kahn (2000 (https://arxiv.org/html/2607.10286#bib.bib71));Hsu 等人 (2010 (https://arxiv.org/html/2607.10286#bib.bib72));Al-Aradi and Jaimungal (2018 (https://arxiv.org/html/2607.10286#bib.bib74))。近期金融 AI 基准和交易代理研究通常报告预测准确性、累积回报或投资组合层面利润 [Ko and Lee (2024 (https://arxiv.org/html/2607.10286#bib.bib21));Li 等人 (2025b (https://arxiv.org/html/2607.10286#bib.bib27));Chen 等人 (2025b (https://arxiv.org/html/2607.10286#bib.bib6));Fan 等人 (2025 (https://arxiv.org/html/2607.10286#bib.bib11))。这些指标很有用,但它们不解释利润是来自市场敞口、资产选择还是动态重新配置。TradeLens 为此目的采用了轻量级归因视图,并将其与系统成本会计相结合,从而根据决策归因的边际(而非仅总利润)来评估可行性。 ## 3 方法:利润-成本可行性 本节定义了如何评估自主交易系统能否为其消耗的智能买单。我们关注两个问题:系统在经济上是否可行,以及其代理决策是否产生足够的增量价值来证明其引发的成本是合理的。 ### 3.1 利润与成本归因 给定一个评估窗口 \([1,T]\),设 \(V_0\) 为初始投资组合价值,\(V_T^{\mathrm{dyn}}\) 为部署的代理系统的已实现期末价值。累计毛利润为: \[ P_{1:T}=V_T^{\mathrm{dyn}}-V_0. \] (1) 利润归因。经典业绩归因分解
相似文章
智能体交易:当LLM智能体遇上金融市场
本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。
TradingAgents:多智能体 LLM 金融交易框架
本文介绍了 TradingAgents,这是一个多智能体 LLM 框架,通过模拟现实世界中的交易公司来提升股票交易表现。该框架利用执行分析和风险管理的专用智能体,在累计收益和夏普比率方面优于基线模型。
AI-Trader:在实时金融市场中对自主智能体进行基准测试
本文介绍了 AI-Trader,这是首个用于评估大语言模型(LLMs)在美股、A股和加密货币等金融决策方面的全自动实时基准测试平台。研究指出,通用智能并不必然保证交易成功,并强调了在自主智能体中风险控制的重要性。
超越智能体架构:基于LLM的交易系统中的执行假设与可重复性
本文综述并审计了基于LLM的交易研究中的执行现实性,提出了更清晰的报告标准以提升可重复性和评估可比性。
TauricResearch/TradingAgents
TradingAgents 是一个用于金融交易的开源多智能体LLM框架,支持多种LLM提供商,最近更新包括新模型和功能。