LLM交易代理在生产中的实际表现:基于两支舰队的六个月、群体规模记录
摘要
本文对生产环境中的LLM交易代理进行了为期六个月的群体规模分析,发现其行为主要由界面设计驱动,仓位大小对波动性不敏感,且缺乏方向性交易优势。
查看缓存全文
缓存时间: 2026/09/09 04:30
论文页面 - 大型语言模型交易代理在生产环境中的实际表现:基于两个舰队的六个月群体规模记录
来源: https://huggingface.co/papers/2609.05663 发布于 9月4日
·
由 https://huggingface.co/poofuse 提交
Poof (https://huggingface.co/poofuse) 于 9月9日
摘要
生产系统中的自主语言模型交易代理表现出由界面设计而非策略驱动的行为,呈现出波动率盲定价,未能捕捉有利价格波动,且未展现出方向性优势,不同前沿模型家族的决策质量在统计上无显著差异。
我们呈现了一份持续的、群体规模的测量记录,记录了在两个具有相同设计谱系的生产系统中运行的自主语言模型交易代理:DX Terminal Pro(3,505 个用户资金库在 2026 年 2 月至 3 月期间交易 Base 网络 meme 币市场的真实 ETH,为期 21 天)和 DXAP 活跃 alpha 舰队(500 至 599 个用户创建的代理全历史记录,91 至 117 个并发活跃代理交易 Hyperliquid 永续合约,时间为 2026 年 6 月至 8 月)。该记录跨越约六个月,包含 750 万次单模型调用(https://huggingface.co/papers?q=model%20invocations),约 30 万次链上操作,以及额外的 231,638 次多工具轮次(https://huggingface.co/papers?q=multi-tool%20turns),产生 14,596 笔成交。论文的四个核心发现如下。第一,操作层比任何写在策略文本中的内容更能决定行为:一个风险滑块解释了杠杆率(每级 +0.425),代理固定效应吸收了 60% 的方差,而排行榜渲染边界在因果路由选择中起作用(回归间断点在前 3 名切割处为 1.75 倍)。第二,头寸规模是波动率盲定的:在每个波动率六分位数中,中位杠杆率均为 5.0 倍,且一个持仓姿态滑块单元(占账簿的 11%)包含了 62% 的清算事件。第三,代理几乎未捕捉到他们能触及的任何上行空间:43.2% 的头寸在 24 小时内至少出现了 +300 基点的有利波动,但其中 49.3% 的头寸最终以负交易收益收场;一个机械式的价格区间策略可为每笔头寸挽回 +39.0 基点。第四,两个舰队均未展现出方向性优势。DXAP 舰队不盈利,且落后于匹配的 Hyperliquid 散户基准(往返胜率 41% 对比 50%)。一个基于 416 个生产场景的前沿模型(https://huggingface.co/papers?q=frontier%20models)配对回放联盟发现,在该时间范围内决策质量(https://huggingface.co/papers?q=decision%20quality)在统计上无显著差异,而选择稳定性(https://huggingface.co/papers?q=choice%20stability)在不同模型家族(https://huggingface.co/papers?q=model%20families)间存在显著差异。所有主要结论均经受了日聚类推断、排列零检验和共同费率重述的考验;论文最后提出了一个以自身修正为代价换来的 17 条方法论准则。
查看 arXiv 页面 (https://arxiv.org/abs/2609.05663) 查看 PDF (https://arxiv.org/pdf/2609.05663) 项目页面 (https://www.dxrg.ai/blogs/continuous-record-paper) GitHub0 (https://github.com/ProjectDXAI/continuous-record-llm-trading-agents) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05663)
在您的代理中获取本文:
hf papers read 2609.05663
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2609.05663 以从本页链接它。
引用本文的数据集 0
没有数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.05663 以从本页链接它。
引用本文的 Spaces 0
没有 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.05663 以从本页链接它。
包含本文的收藏集 0
没有包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
智能体交易:当LLM智能体遇上金融市场
本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。
TradingAgents:多智能体 LLM 金融交易框架
本文介绍了 TradingAgents,这是一个多智能体 LLM 框架,通过模拟现实世界中的交易公司来提升股票交易表现。该框架利用执行分析和风险管理的专用智能体,在累计收益和夏普比率方面优于基线模型。
超越智能体架构:基于LLM的交易系统中的执行假设与可重复性
本文综述并审计了基于LLM的交易研究中的执行现实性,提出了更清晰的报告标准以提升可重复性和评估可比性。
@DanKornas: 单个LLM可以将市场数据、讨论和风险模糊成一个不透明的答案。这个仓库将工作分散到专门的……
TradingAgents 是一个开源的金融分析多智能体LLM框架,将市场数据通过专门的智能体进行路由以进行研究。
QuantAgent:基于价格驱动的多智能体大语言模型高频交易框架
QuantAgent 是一个专为高频交易设计的多智能体大语言模型框架,通过四个专业智能体(指标、形态、趋势、风险)基于短周期信号快速做出具有风险意识的交易决策。在对比比特币和纳斯达克期货在内的十种金融工具的零样本评估中,该框架在预测准确率和累计收益方面均优于现有的神经网络和规则驱动基线模型。