AI交易:评估大语言模型在技术市场分析中的表现

arXiv cs.AI 论文

摘要

本文采用基准方法,评估了大语言模型在交易中进行技术市场分析的能力。

arXiv:2607.15414v1 公告类型:交叉 摘要:大语言模型(LLMs)已成为处理现代金融市场异构信息环境的强大工具。本文对五种著名LLM进行了系统性的比较评估:GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Pro、Llama 3 70B以及领域专用FinGPT,评估它们的技术市场分析能力。评估涵盖四个结构化任务:基于OHLCV数据的K线模式识别、方向性信号生成(买入/卖出/持有)、通过模拟执行管道对信号质量进行回测,以及财务报表理解。我们的实验框架采用严格的定量指标,包括夏普比率、最大回撤、索提诺比率、信息系数、F1分数和BLEU分数。模拟回测结果表明,GPT-4 Turbo在通用模型中实现了最高的年化收益率和夏普比率,而FinGPT由于领域特定的微调,表现出具有竞争力的风险调整后收益。在测试条件下,两个模型均优于被动S&P 500基准。研究还识别了所有评估模型持续存在的失败模式,包括数值幻觉、上下文窗口限制以及在横盘市场状态下表现不一致。我们得出结论:尽管LLM在AI交易系统中具有真正的潜力,但稳健部署需要仔细的任务分解、严格的回测协议以及领域感知的微调策略。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:24

# AI交易:评估大语言模型在技术市场分析中的表现
来源:https://arxiv.org/abs/2607.15414
书目工具

## 书目与引用工具

书目浏览器切换

代码、数据与媒体

## 本文关联的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

IArxiv 推荐器切换

关于 arXivLabs

## arXivLabs:与社区合作者共同进行的实验项目

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织均接受并采纳了我们关于开放性、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并仅与遵守这些价值观的合作伙伴合作。

有一个能为 arXiv 社区增添价值的项目想法?**了解更多关于 arXivLabs**(https://info.arxiv.org/labs/index.html)。

相似文章

利用语言模型进行全球并购套利预测

arXiv cs.CL

本文提出了一种用于并购套利的语言模型预测系统,该系统结合了专家引导的上下文工程和对历史交易的精调,在覆盖42个国家400多笔大型交易中取得了最先进的性能。

QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准

Hugging Face Daily Papers

# 论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准 来源:[https://huggingface.co/papers/2604.15151](https://huggingface.co/papers/2604.15151) ## 摘要 QuantCode\-Bench 通过测试大语言模型能否将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估其生成可执行交易策略的能力。