AI交易:评估大语言模型在技术市场分析中的表现
摘要
本文采用基准方法,评估了大语言模型在交易中进行技术市场分析的能力。
arXiv:2607.15414v1 公告类型:交叉
摘要:大语言模型(LLMs)已成为处理现代金融市场异构信息环境的强大工具。本文对五种著名LLM进行了系统性的比较评估:GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Pro、Llama 3 70B以及领域专用FinGPT,评估它们的技术市场分析能力。评估涵盖四个结构化任务:基于OHLCV数据的K线模式识别、方向性信号生成(买入/卖出/持有)、通过模拟执行管道对信号质量进行回测,以及财务报表理解。我们的实验框架采用严格的定量指标,包括夏普比率、最大回撤、索提诺比率、信息系数、F1分数和BLEU分数。模拟回测结果表明,GPT-4 Turbo在通用模型中实现了最高的年化收益率和夏普比率,而FinGPT由于领域特定的微调,表现出具有竞争力的风险调整后收益。在测试条件下,两个模型均优于被动S&P 500基准。研究还识别了所有评估模型持续存在的失败模式,包括数值幻觉、上下文窗口限制以及在横盘市场状态下表现不一致。我们得出结论:尽管LLM在AI交易系统中具有真正的潜力,但稳健部署需要仔细的任务分解、严格的回测协议以及领域感知的微调策略。
查看缓存全文
缓存时间: 2026/07/20 09:24
# AI交易:评估大语言模型在技术市场分析中的表现 来源:https://arxiv.org/abs/2607.15414 书目工具 ## 书目与引用工具 书目浏览器切换 代码、数据与媒体 ## 本文关联的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 IArxiv 推荐器切换 关于 arXivLabs ## arXivLabs:与社区合作者共同进行的实验项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。 与 arXivLabs 合作的个人和组织均接受并采纳了我们关于开放性、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并仅与遵守这些价值观的合作伙伴合作。 有一个能为 arXiv 社区增添价值的项目想法?**了解更多关于 arXivLabs**(https://info.arxiv.org/labs/index.html)。
相似文章
利用大语言模型增强基本面分析:基于RAG的投资者简报生成系统
本文探讨了使用大语言模型与RAG系统,通过处理财务报告和宏观经济数据来自动化公司基本面分析,生成由个人投资者评估的投资者简报。
大型语言模型黑盒不确定性估计方法的系统性评估
本文对4种模型和4种数据集设置下的24种黑盒不确定性估计方法进行了系统性回顾和基准测试,发现没有任何单一方法占主导地位,但结合多种不确定性信号的混合方法表现出色。
利用语言模型进行全球并购套利预测
本文提出了一种用于并购套利的语言模型预测系统,该系统结合了专家引导的上下文工程和对历史交易的精调,在覆盖42个国家400多笔大型交易中取得了最先进的性能。
QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准
# 论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准 来源:[https://huggingface.co/papers/2604.15151](https://huggingface.co/papers/2604.15151) ## 摘要 QuantCode\-Bench 通过测试大语言模型能否将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估其生成可执行交易策略的能力。
通过检索增强大型语言模型提升金融情感分析
本文介绍了一种检索增强的大型语言模型框架用于金融情感分析,相比传统模型及ChatGPT、LLaMA等大型语言模型,在准确率和F1分数上实现了15%至48%的提升。