面向LLM增强型投资组合决策的语义状态抽象接口:多轴新闻分解与RL诊断

arXiv cs.LG 论文

摘要

本文引入了语义状态抽象接口(SSAI),旨在将LLM增强型投资组合决策中的表征假设与优化方差分离开来。研究结论指出,SSAI的表观优势很大程度上源于篮子选择效应,而在实证上,密集编码和主成分表现更佳。

arXiv:2605.06730v1 公告类型:新论文 摘要:我们引入了语义状态抽象接口(SSAI):一种方法论模板,用于将稀疏的非结构化文本映射到 $K$ 个可审计的命名坐标中,并在无新闻日采用中性默认值,旨在将连续决策系统中的表征假设与优化方差分离开来。我们的贡献在于该框架及其评估协议,而非宣称SSAI优于更密集的替代方案。 我们将SSAI实例化为 $K=4$ 个轴(情感、风险、信心、波动率预测),应用于美国股票面板(30只纳斯达克100指数成分股,FNSPID新闻数据,2019--2023年测试集),并在直接因子组合、监督岭回归预测器和强化学习智能体(DP-PPO, SAC)中对其进行评估,这些智能体共享相同的固定 $\phi$。四因子组合实现了307.2%的累计收益率和1.067的夏普比率,但与买入并持有策略(243.6%)相比的表观收益未能通过覆盖分层控制检验,在成本 $\geq 0.2$% 时收益逆转,且与仅情感基线相比在统计上较为脆弱;在此设置下,PC1复合指标和FinBERT组合基线提供了更强的排序信号。岭回归和RL模块用于诊断表征与优化器效应。我们将SSAI定位为一种可复用的协议,作为稀疏文本决策系统中的可解释性-性能诊断工具。
查看原文
查看缓存全文

缓存时间: 2026/05/11 06:44

# 面向大语言模型增强型投资组合决策的语义状态抽象接口:多轴新闻分解与强化学习诊断

来源:https://arxiv.org/html/2605.06730
Likhita Yerra AIVANCITY School of AI & Data likhita\.yerra@aivancity\.education & Remi Uttejitha Allam AIVANCITY School of AI & Data remi\.allam@aivancity\.education

###### 摘要

我们引入了**语义状态抽象接口(Semantic State Abstraction Interfaces, SSAI)**:这是一种方法论模板,旨在将稀疏的非结构化文本映射为 $K$ 个可审计的命名坐标,并在无新闻日设置中性默认值,从而在顺序决策系统中分离表示假设与优化方差。我们的贡献在于该框架及其评估协议——而非声称 SSAI 优于更稠密的替代方案。

我们将 SSAI 实例化为 $K=4$ 个轴(*情感*、*风险*、*置信度*、*波动率预测*),应用于美国股票面板(30 只 NASDAQ-100 股票,FNSPID 新闻数据,2019–2023 年测试期),并在三个并行估计器上进行评估:直接因子投资组合(SFP/SRF/SCW)、监督岭回归预测器以及强化学习智能体(DP-PPO, SAC)。这些估计器共享固定的 $\phi$,使得信号效应和优化器效应可以被单独观察。

实验展示了什么。四因子 SFP 在 2019–2023 年间实现了 307.2% 的累计收益率(CR)/ 1.067 的夏普比率。*然而*,这种相对于买入并持有策略(243.6%)的表观优势并未通过其自身的控制检验:在每个覆盖率三分位区间内,SFP 的表现均弱于分层匹配的买入并持有策略(表3 (https://arxiv.org/html/2605.06730#S5.T3)),在每笔交易成本 $\geq 0.2\%$ 时逆转,且四因子与仅情感因子的每日优势并不显著(Wilcoxon $p=0.556$)。四轴的数据驱动第一主成分(PC1-SFP)在同一投资组合规则下实现了 433.6% 的累计收益率——比 SSAI 高出 126 个百分点——而 FinBERT 直接投资组合基准实现了 386.3%(表5 (https://arxiv.org/html/2605.06730#S5.T5))。诚实的总结是,SSAI 投资组合的优势主要是一个*选股组合效应*,在此设置下,PC1 和稠密神经编码在经验上提供了更强的排序信号。

实验还展示了什么。简单附加稀疏的大语言模型列会损害岭回归预测;高置信度的语义倾斜和词汇基线(VADER, TF–IDF/SVD)恢复了仅价格夏普比率。强化学习模块起到诊断作用:DP-PPO 落后于买入并持有;使用相同 SSAI 观测值的 SAC 提高了夏普比率(1.128 对 1.032),隔离了算法依赖性而非表示优势。21 个 DP-PPO 种子间的均值夏普比率差异不显著(Wilcoxon $p \approx 0.25$–0.31)。

贡献框架。我们将 SSAI 作为一种*可解释性-性能前沿*工具和*警示性诊断工具*进行呈现:它描述了维护可审计轴的代价(相对于 PC1,五年累计收益率低 126 个百分点),表明强化学习性能主要由算法选择决定而非表示质量,并为在其他稀疏文本决策场景中分离语义信号与优化噪声提供了可复用的模板。

## 1 引言

深度强化学习(DRL)在顺序决策问题中被广泛研究,其中观测数据混合了数值信号与非结构化证据(Mnih et al.,2015 (https://arxiv.org/html/2605.06730#bib.bib12); Schulman et al.,2017 (https://arxiv.org/html/2605.06730#bib.bib15); Liu et al.,2021 (https://arxiv.org/html/2605.06730#bib.bib7))。大语言模型(LLMs)为文本提供了灵活的编码器(Brown et al.,2020 (https://arxiv.org/html/2605.06730#bib.bib3); Liu et al.,2023 (https://arxiv.org/html/2605.06730#bib.bib9); Wu et al.,2023 (https://arxiv.org/html/2605.06730#bib.bib17)),但大多数流程模糊了一个基本的设计问题:文本证据应表现为高维潜在向量、单一标量(例如,情感)还是少量命名语义坐标——特别是当文本仅在决策日期的一个稀疏子集中出现时?

先前的工作以有限的方式将自然语言处理(NLP)与强化学习交易联系起来。Yang et al. (2020a (https://arxiv.org/html/2605.06730#bib.bib18)) 仅使用技术指标作为状态表示;Benhenda (2025 (https://arxiv.org/html/2605.06730#bib.bib2)) 添加了来自 DeepSeek-V3 的单一情感得分;Lopez-Lira and Tang (2023 (https://arxiv.org/html/2605.06730#bib.bib10)) 使用 ChatGPT 将每日市场情感分类为二元信号。单一情感得分信息稀疏:它将正交概念混淆——标题是否为正面与底层情况是否*有风险*或市场是否可能*波动*有着根本区别。

#### 贡献。

我们引入了**语义状态抽象接口(SSAI)**:映射 $\phi$ 从文档集 $\mathcal{N}_{s,d}$ 到由冻结大语言模型通过固定提示激发的 $K$ 个可审计轴,当 $\mathcal{N}_{s,d}=\emptyset$ 时具有中性默认值(定义1,附录A (https://arxiv.org/html/2605.06730#A1))。核心贡献是一种**评估设计**,通过构造分离表示与优化:固定的、共享的 $\phi$ 同时由低方差估计器(因子投资组合、岭回归预测器)和高方差非线性估计器(DP-PPO, SAC)进行评估,使得两种效应均可单独观察。SSAI 轴是可审计的,并支持提示级消融,代价是预测性能;这一约束是一种方法论选择。所有实证验证均基于上述美国股票面板;定义1 是领域无关的(附录D (https://arxiv.org/html/2605.06730#A4))。

#### 研究问题。

我们围绕三个具体问题组织实验:**RQ1**:相对于中性掩码输入,多轴大语言模型信号是否改变策略行为?**RQ2**:任何大语言模型轴是否与实现的市场数量对齐,即使是弱对齐?**RQ3**:观察到的性能主要是语义状态表示的属性,还是利用它的学习算法的属性?结果是保守的:四因子 SFP 比仅情感高 15 个百分点的累计收益率(不显著;组合伪影);监督式大语言模型特征仅作为稀疏高置信度倾斜有所帮助;强化学习掩码具有方向性但力度不足;在相同的 SSAI 状态下,SAC 显著提高了相对于 DP-PPO 的夏普比率。

我们提出三项贡献,每项均为诊断性质而非性能竞争性质:

1.  **SSAI 模板(可复用框架)**。定义1 为顺序决策系统中的稀疏文本提供了一个领域无关、可审计的接口,此处实例化为 $K=4$ 个整数值轴和中性默认值。该模板专为需要轴级可审计性、人在回路覆盖或提示扰动测试的场景设计——而非以最大化累计收益为唯一目标的场景。
2.  **带有警示性发现的诊断评估协议**。三个并行估计器(SFP/SRF/SCW、岭回归预测器、强化学习智能体)共享相同的 $\phi$,隔离表示与优化效应。主要发现是*警示性的*:SFP 与买入并持有之间 63 个百分点的差距是一个组合伪影(在分层控制内失败,在 $\geq 0.2\%$ 成本下逆转);四轴的主成分 PC1 在累计收益率上比 SSAI 高出 126 个百分点;FinBERT 直接投资组合基准比 SSAI 高出 79 个百分点。这是本文最重要的实证结果。
3.  **可解释性-性能前沿表征**。表5 (https://arxiv.org/html/2605.06730#S5.T5) 将 SSAI 置于与 PC1 和 FinBERT-SFP 相同的前沿,使得可解释性约束的代价可以精确衡量:相对于使用相同每日前10规则的最佳替代方案,五年累计收益率低 126 个百分点。这种前沿表征——而非性能声明——是对大语言模型增强决策文献的拟议贡献。

## 2 相关工作

Liu et al. (2021 (https://arxiv.org/html/2605.06730#bib.bib7)) 介绍了带有 PPO 和 SAC 基准的 FinRL(Yang et al.,2020b (https://arxiv.org/html/2605.06730#bib.bib19); Liu et al.,2022 (https://arxiv.org/html/2605.06730#bib.bib8));风险约束强化学习使用了 CVaR 目标(Tamar et al.,2015 (https://arxiv.org/html/2605.06730#bib.bib16))和拉格朗日松弛(Ray et al.,2019 (https://arxiv.org/html/2605.06730#bib.bib13))。FinGPT(Liu et al.,2023 (https://arxiv.org/html/2605.06730#bib.bib9))和 BloombergGPT(Wu et al.,2023 (https://arxiv.org/html/2605.06730#bib.bib17))在金融语料库上微调大语言模型;Benhenda (2025 (https://arxiv.org/html/2605.06730#bib.bib2)) 在强化学习状态中添加标量 DeepSeek-V3 情感得分。我们将先前的标量情感接口(Benhenda,2025 (https://arxiv.org/html/2605.06730#bib.bib2); Lopez-Lira and Tang,2023 (https://arxiv.org/html/2605.06730#bib.bib10))扩展为通过零样本多轴提示实例化的 SSAI(无编码器微调),并在投资组合、监督学习器和强化学习方面附加诊断评估。新闻数据来自 FNSPID(Dong et al.,2024 (https://arxiv.org/html/2605.06730#bib.bib4))。

**定位**。与端到端训练 $\phi$ 的表示学习(Bengio et al.,2013 (https://arxiv.org/html/2605.06730#bib.bib1))或解耦方法(Higgins et al.,2017 (https://arxiv.org/html/2605.06730#bib.bib5))不同,SSAI 通过提示设计*预先固定* $\phi$,无需编码器训练即可实现命名轴的可解释性。与事后方法(LIME(Ribeiro et al.,2016 (https://arxiv.org/html/2605.06730#bib.bib14)),SHAP(Lundberg and Lee,2017 (https://arxiv.org/html/2605.06730#bib.bib11)))不同,SSAI 不需要单独的解释步骤:轴由构造即可解释。SSAI 填补的关键空白是*共享接口*:在不同复杂度的估计器之间固定 $\phi$,使得表示和优化效应可单独观察。

**可解释性的含义**。我们在全文中使用“可解释性”这一术语有三种不同的含义,现在明确说明:*(a) 轴级人类可读语义*:每个轴都有固定的自然语言名称和整数范围,允许从业者直接读取“模型在这一天将风险从2提高到4”,而无需事后处理。*(b) 通过提示扰动进行事后审计*:固定 $\phi$ 启用受控的反事实测试——可以使用修改后的提示重新评分并观察对下游决策的影响,这对于联合训练的编码器来说是不可能的。*(c) 监管可读性*:命名轴上的整数得分可以用通俗语言向合规团队解释;主成分载荷则不行。SSAI 通过构造提供了属性 (a)-(c)。PC1 和 FinBERT 均未提供 (a)-(c) 中的任何一项。表5 (https://arxiv.org/html/2605.06730#S5.T5) 和 第5.4节 (https://arxiv.org/html/2605.06730#S5.SS4) 中的可解释性-性能分析应理解为共同表征属性 (a)-(c) 的代价。

**基线范围**。我们使用确定性投资组合和匹配的监督学习器隔离 SSAI 设计选择;词汇标题聚合(VADER;训练拟合 TF–IDF/SVD)现在作为稠密岭回归输入出现(表4 (https://arxiv.org/html/2605.06730#S5.T4))。表5 (https://arxiv.org/html/2605.06730#S5.T5) 添加了 FinBERT 直接投资组合基线(FinBERT-SFP, 386.3% 累计收益率)和 PC1 基线(PC1-SFP, 433.6% 累计收益率),均在同一前10规则下。本提交*未*涵盖的内容:FinBERT 或稠密嵌入作为强化学习状态向量、多种子因子投资组合评估,或与 FinGPT/BloombergGPT 完整编码器的比较——这些仍是开放差距(见局限性,第6节 (https://arxiv.org/html/2605.06730#S6))。

## 3 方法

新闻到策略管道的示意图见图2 (https://arxiv.org/html/2605.06730#A2.F2)(附录B (https://arxiv.org/html/2605.06730#A2))。

### 3.1 多信号大语言模型评分

给定关于股票代码 $s$ 的新闻文章标题或摘要 $t$,我们向大语言模型发出一个结构化提示,并提取四个整数得分 $\sigma=(\sigma_{\text{sent}},\sigma_{\text{risk}},\sigma_{\text{conf}},\sigma_{\text{vol}})\in\{1,\ldots,5\}^4$。

$\sigma_{\text{sent}}$ 情感:1 = 非常负面,5 = 非常正面。
$\sigma_{\text{risk}}$ 风险:1 = 公司/市场风险非常低,5 = 风险非常高。
$\sigma_{\text{conf}}$ 置信度:1 = 前景非常不确定,5 = 非常确定。
$\sigma_{\text{vol}}$ 波动率预测:1 = 预期价格非常平静,5 = 高度波动。

我们使用显式轴而不是稠密文章嵌入,因为本研究旨在审计状态接口,而不仅仅是最大化预测能力。整数坐标支持股票代码-日覆盖率检查、对情感的残差化、留一轴掩码,以及对策略或排名规则为何改变敞口的部署级解释。稠密潜在文本编码器和价格-新闻 Transformer 是自然更强的基线,但它们没有提供相同的轴级因果和诊断手柄,除非附加归因机制。

提示使用定义四个轴和两个少样本示例的系统指令;每次大语言模型调用最多批处理20篇文章。我们将此协议应用于 FNSPID NASDAQ 子集中的 40,850 篇文章,成功评分 39,995 篇(97.9%)。

> **大语言模型身份(可复现性)**。评分使用 `gpt-4o`(OpenAI chat-completions API,模型快照 `gpt-4o-2024-08-06`)于 2024 年 8 月至 10 月期间完成,温度设置为 0,top-p 设置为 1。完整的提示模板,包括每轴的评分标准和两个典型的少样本示例,逐字包含在人工制品包中(`prompts/score_news.txt`)。评分是单次进行的;除上述报告的 97.9% 解析成功率外,未进行任何事后重新评分或过滤。评分摘要见表14 (https://arxiv.org/html/2605.06730#A6.T14)(附录F (https://arxiv.org/html/2605.06730#A6));风险和波动率呈右偏分布(均值 $\approx 2.5$),与金融标题中的负面新闻偏差一致。

聚合到交易面板后的信号覆盖率不均匀:这种稀疏性是我们将接口视为弱语义因子而非稠密预测信号的核心原因。重要的是,直接投资组合实验已经对此进行了控制:SFP 仅在非中性覆盖率的日子使用信号偏差,并且在 2019–2023 年间优于等权买入并持有 63.6 个百分点——这一差距不能仅归因于覆盖率,因为跨 21 个种子的完整评分评估均值超过了相同检查点的中性掩码评估(表8 (https://arxiv.org/html/2605.06730#S5.T8))。

信号覆盖率、每轴信息系数(IC)以及四面板内部验证(评分分布、跨信号 Spearman 相关系数 $|\rho|=0.58$–0.81、滞后1自相关 0.47–0.57、以及置信度 IC $p=0.004$)报告在附录F (https://arxiv.org/html/2605.06730#A6) 中(图4 (https://arxiv.org/html/2605.06730#A6.F4),表15 (https://arxiv.org/html/2605.06730#A6.T15), 16 (https://arxiv.org/html/2605.06730#A6.T16))。关键要点:评分并非白噪声——它们表现出金融新闻预期的方向性跨轴结构,并在股票代码层面具有时间持续性。*有效维度注意事项:* 对非中性股票日($N=5,579$)的四轴主成分分析发现,PC1 解释了 82.1% 的方差(PC1+PC2: 91.8%),因此 SSAI 的有效维度约为 1——四个轴主要捕捉单一的情感-风险极性。SRF 的残差化解决了这个低维空间内的线性冗余。*经济幅度注意事项:* 置信度 IC $p=0.004$ 在统计上是显著的,但在

相似文章

AlphaSchema:探索基于LLM的Alpha挖掘的交易语义空间

arXiv cs.AI

该预印本介绍了AlphaSchema,一个为基于LLM的Alpha挖掘构建并探索结构化交易语义空间的框架,将语义探索与因子实现解耦。在中国股市上的实验表明,它能够发现具有强预测能力和投资组合表现的因子池。

学习预测性模糊集以用于面向决策的分布鲁棒优化

arXiv cs.LG

提出学习预测性模糊集(LPAS)用于分布鲁棒优化,其中深度上下文模型输出名义情景分布、状态依赖的Wasserstein半径和基础度量,并通过决策损失和校准进行训练。应用于S&P 500数据的投资组合优化,该方法实现了更高的回报和夏普比率,同时相比于固定半径基线减少了保守性。