LLM交易代理在生产中的实际表现:基于两支舰队的六个月、群体规模记录

Hugging Face Daily Papers 论文

摘要

本文对生产环境中的LLM交易代理进行了为期六个月的群体规模分析,发现其行为主要由界面设计驱动,仓位大小对波动性不敏感,且缺乏方向性交易优势。

我们展示了一个连续的、群体规模的测量记录,记录了自主语言模型交易代理在两个具有同一设计血统的生产系统中的运作:DX Terminal Pro(3,505个用户资助的金库,在Base memecoin市场交易真实ETH,为期21天,2026年2月至3月)和DXAP实时alpha舰队(500至599个用户创建的代理全历史,91至117个并发活跃,交易Hyperliquid永续合约,2026年6月至8月)。该记录跨越约六个月,750万次单模型调用,约30万次链上操作,以及另外231,638次多工具交互产生14,596次成交。本文有四大发现。第一,操作层比策略文本中的任何内容更能决定行为:风险滑块解释了杠杆(每个级别+0.425),代理固定效应吸收了60%的方差,排行榜渲染边界因果性地引导选择(在前三名截止处回归不连续性为1.75倍)。第二,仓位大小对波动性不敏感:每个波动性六分位数的中位数杠杆均为5.0倍,并且一个姿势滑块单元(占账簿的11%)持有62%的清算。第三,代理几乎未捕捉到它们达到的任何上行空间:43.2%的头寸在24小时内至少有+300个基点的有利波动,但其中49.3%以负交易回报结束;机械性括号每个头寸恢复+39.0个基点。第四,两支舰队均未显示方向性优势。DXAP舰队无利可图,落后于匹配的Hyperliquid散户基准(往返胜率41%对50%)。在416个捕获的生产场景上对前沿模型进行配对重放联赛,发现在此时间范围内决策质量在统计上无法区分,而选择稳定性在不同模型系列间差异显著。所有标题均通过日聚类推断、排列零假设和共同费用重述得以验证;本文以17条方法论准则收尾,这些准则源于我们自己的撤回。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:30

论文页面 - 大型语言模型交易代理在生产环境中的实际表现:基于两个舰队的六个月群体规模记录

来源: https://huggingface.co/papers/2609.05663 发布于 9月4日

·

由 https://huggingface.co/poofuse 提交

Poof (https://huggingface.co/poofuse) 于 9月9日

摘要

生产系统中的自主语言模型交易代理表现出由界面设计而非策略驱动的行为,呈现出波动率盲定价,未能捕捉有利价格波动,且未展现出方向性优势,不同前沿模型家族的决策质量在统计上无显著差异。

我们呈现了一份持续的、群体规模的测量记录,记录了在两个具有相同设计谱系的生产系统中运行的自主语言模型交易代理:DX Terminal Pro(3,505 个用户资金库在 2026 年 2 月至 3 月期间交易 Base 网络 meme 币市场的真实 ETH,为期 21 天)和 DXAP 活跃 alpha 舰队(500 至 599 个用户创建的代理全历史记录,91 至 117 个并发活跃代理交易 Hyperliquid 永续合约,时间为 2026 年 6 月至 8 月)。该记录跨越约六个月,包含 750 万次单模型调用(https://huggingface.co/papers?q=model%20invocations),约 30 万次链上操作,以及额外的 231,638 次多工具轮次(https://huggingface.co/papers?q=multi-tool%20turns),产生 14,596 笔成交。论文的四个核心发现如下。第一,操作层比任何写在策略文本中的内容更能决定行为:一个风险滑块解释了杠杆率(每级 +0.425),代理固定效应吸收了 60% 的方差,而排行榜渲染边界在因果路由选择中起作用(回归间断点在前 3 名切割处为 1.75 倍)。第二,头寸规模是波动率盲定的:在每个波动率六分位数中,中位杠杆率均为 5.0 倍,且一个持仓姿态滑块单元(占账簿的 11%)包含了 62% 的清算事件。第三,代理几乎未捕捉到他们能触及的任何上行空间:43.2% 的头寸在 24 小时内至少出现了 +300 基点的有利波动,但其中 49.3% 的头寸最终以负交易收益收场;一个机械式的价格区间策略可为每笔头寸挽回 +39.0 基点。第四,两个舰队均未展现出方向性优势。DXAP 舰队不盈利,且落后于匹配的 Hyperliquid 散户基准(往返胜率 41% 对比 50%)。一个基于 416 个生产场景的前沿模型(https://huggingface.co/papers?q=frontier%20models)配对回放联盟发现,在该时间范围内决策质量(https://huggingface.co/papers?q=decision%20quality)在统计上无显著差异,而选择稳定性(https://huggingface.co/papers?q=choice%20stability)在不同模型家族(https://huggingface.co/papers?q=model%20families)间存在显著差异。所有主要结论均经受了日聚类推断、排列零检验和共同费率重述的考验;论文最后提出了一个以自身修正为代价换来的 17 条方法论准则。

查看 arXiv 页面 (https://arxiv.org/abs/2609.05663) 查看 PDF (https://arxiv.org/pdf/2609.05663) 项目页面 (https://www.dxrg.ai/blogs/continuous-record-paper) GitHub0 (https://github.com/ProjectDXAI/continuous-record-llm-trading-agents) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05663)

在您的代理中获取本文:

hf papers read 2609.05663

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2609.05663 以从本页链接它。

引用本文的数据集 0

没有数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.05663 以从本页链接它。

引用本文的 Spaces 0

没有 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.05663 以从本页链接它。

包含本文的收藏集 0

没有包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

智能体交易:当LLM智能体遇上金融市场

arXiv cs.AI

本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。

TradingAgents:多智能体 LLM 金融交易框架

Papers with Code Trending

本文介绍了 TradingAgents,这是一个多智能体 LLM 框架,通过模拟现实世界中的交易公司来提升股票交易表现。该框架利用执行分析和风险管理的专用智能体,在累计收益和夏普比率方面优于基线模型。

QuantAgent:基于价格驱动的多智能体大语言模型高频交易框架

Papers with Code Trending

QuantAgent 是一个专为高频交易设计的多智能体大语言模型框架,通过四个专业智能体(指标、形态、趋势、风险)基于短周期信号快速做出具有风险意识的交易决策。在对比比特币和纳斯达克期货在内的十种金融工具的零样本评估中,该框架在预测准确率和累计收益方面均优于现有的神经网络和规则驱动基线模型。