同一天,同一故事;提前一天,不同信号:金融情绪的双重效度
摘要
本文测试了这样一个假设:在金融自然语言处理中,经人类标签验证的情绪工具也能预测市场信号,结果发现基准一致性并不决定预测有效性,且垃圾信息影响基于交易量的分析。
arXiv:2609.11144v1 公告类型:新
摘要:金融自然语言处理有一个标准工作流程:使用人类标签验证情绪工具,然后信任其提取市场信号。这假设两项评估衡量的是相同的东西。我们在一个可以同时测量两者的环境中测试该假设:一个证券集体诉讼语料库(2002-2025年),将70,500条X消息与异常股票收益联系起来,并带有单标注者人类标注的金标准样本。通过一个相同的流程运行五种工具(VADER、Loughran-McDonald、FinBERT、Twitter-RoBERTa和一个LLM标注器),我们发现构建效度和预测效度之间的关系取决于采样惯例和分数表示。在传统的特定方法采样下,人类一致性更接近于分级同日关联,而不是一日领先。然而,在固定n面板上,一致性在两个时间范围内具有相似的分级排名相关性,而粗略排序仍然较弱。因此,基准一致性建立了语义效度,但本身并不决定预测排名。在一段包含17.6%垃圾信息的对话中,消息量既不能预测市场损害,也不能预测和解规模。
查看缓存全文
缓存时间: 2026/09/12 08:22
# 同日同故事;隔日异信号:金融情绪的双重效度验证 来源:https://arxiv.org/html/2609.11144 Laven Srivastava 隶属机构:Perssonify Harsh Nandwani 隶属机构:Perssonify [email protected] ###### 摘要 金融自然语言处理存在标准流程:先通过人工标注验证情绪分析工具,再依赖该工具提取市场信号。这一流程默认两种评估方式衡量的是同一指标。我们在可同时测量两者的场景中检验该假设:构建了一个包含证券集体诉讼(2002-2025年)的语料库,将70,500条X(前身为Twitter)消息与异常股票回报相关联,并配有单标注员人工标注的黄金样本。通过同一标准化流程运行五种工具(VADER、Loughran-McDonald词典、FinBERT、Twitter-RoBERTa及LLM标注器),我们发现构念效度与预测效度的关系取决于采样规范及评分表征方式。在常规方法特异性采样下,人工标注一致性更贴近分级同日关联而非隔日领先关联。但在固定NN面板下,一致性在两种时间跨度上呈现相似的分级秩相关,而粗略排序仍较弱。基准一致性虽能确立语义效度,但其本身并不能决定预测排序。当对话中17.6%为垃圾信息时,消息数量既不能预测市场损害程度,也无法预测和解金额。 ## 1 引言 自然语言处理领域验证情绪工具的方式与分类器通用验证方法相同:通过标注样本中与人工标注的一致性进行评估。但在金融领域,其应用目的不同——旨在捕捉与资产价格运动相关联、理想情况下先于价格变动的信号。这两种标准常被混为一谈,仿佛前者蕴含后者。在情绪基准测试中表现优异的工具,通常被默认为更适合提取市场信号。但这一假设很少被检验,因为两种评估通常在不同语料库上进行:人工标注基准不包含市场结果,而市场数据集缺乏人工标签。 本文直接检验该假设:我们构建了一个语料库,使相同消息同时承载两种属性。证券集体诉讼提供了关联机制:法院起诉书提供事件锚点和诉讼元数据,被告股价历史提供异常回报,而周围的社交媒体对话则通过五种工具自动标注及黄金样本人工标注进行文本处理。所有工具采用相同的聚合与测试流程。我们既比较方法特异性样本,也分析固定日期集合——因为保留的日期也会影响结果。 该领域具有天然对抗性:更正披露与文件虽引发真实投资者讨论,但也伴随着原告律所营销、重复新闻标题及自动化推广。其中律所营销具有结构性(《私人证券诉讼改革法案》要求首个立案原告必须发布通知,邀请其他投资者申请首席原告职位),导致每个案件机械性地产生律所新闻稿激增(Choi等人,2024)。标题重复是金融新闻的已知特征(Tetlock, 2011),而机器人则借新闻公司的股票标签推广无关证券(Cresci等人,2019)。本语料库中垃圾信息占比17.6%,营销与垃圾信息合计达25,166条消息。因此,单纯计数本身就是缺陷指标——其会同等吸收所有信息源。我们提出三个研究问题: - • RQ1:与人工情绪判断的一致性是否能预测工具与异常回报的关联强度? - • RQ2:若一致性与关联性出现分歧,这种分歧发生在何种时间跨度?各工具实际响应的是什么? - • RQ3:关于诉讼讨论的哪些结论对工具选择具有不变性,哪些则不然? 我们的贡献如下: 1. 1. **双重效度语料库发布**:发布涵盖845起证券集体诉讼(2002-2025年)的66,890条事件锚定消息,携带五种工具的情绪标签及多维LLM标注,并配有400条消息的人工黄金标准及其标注手册与一致性统计数据。据我们所知,这是首个公开的金融社交媒体语料库,使同一消息同时承载人工标注与关联市场结果,从而可通过单一管道测量两种效度。 2. 2. **两种效度关系依赖采样方式**:在常规方法特异性采样下,人工一致性更贴近分级同日关联而非隔日领先关联;在固定NN面板上,分级排序在两种时间跨度相似,但粗略排序仍较弱。构念效度与预测效度的关系取决于时间跨度、表征方式及零分日期的处理。 3. 3. **机制分析与工具排序不稳定性**:在常规方法特异性采样下,隔日点估计最大的工具是在金融新闻上预训练的模型——新闻账号携带最强归因信号(ρ=-0.261),且局部投影安慰剂检验在负时间跨度失效。 4. 4. **领域结果与有意义的零结果**:尽管存在系统性污染,内容信息量仍优于数量信息——消息数量既不能预测价格下跌深度,也无法预测美元和解金额。 ## 2 相关工作 #### 金融对话中的内容与数量 市场参与者言论内容与发帖数量的区别源自论坛研究:Tumarkin和Whitelaw(2001)发现发帖活动几乎不包含回报信息;Antweiler和Frank(2004)证明消息内容承载信号而数量主要预测波动率;Das和Chen(2007)构建了首个针对股票讨论的定制化情绪分类器。媒体悲观情绪预测市场活动(Tetlock, 2007),公司层面语言预测基本面(Tetlock等人, 2008),众包投资观点内容预测回报与盈利意外(Chen等人, 2014)。消息数量属于注意力指标家族,与搜索强度(Da等人, 2011)及由此引发的注意力驱动交易(Barber和Odean, 2008)相关。我们将“内容优于数量”的规律视为既定事实并作为领域检验;本文主张则关注如何评估测量内容的工具。 #### 情绪工具及其基准评估 我们比较的工具涵盖标准工具箱:社交媒体词典(Hutto和Gilbert, 2014)、金融词典(Loughran和McDonald, 2011)、在金融新闻(Araci, 2019)和推文(Barbieri等人, 2020)上预训练的Transformer模型。此类工具通常通过与人工标注的一致性进行评估,Financial PhraseBank(Malo等人, 2014)是标准基准;近期套件将同一范式扩展至金融大语言模型(Xie等人, 2023, 2024),使得一致性所预测的下游效应问题更为关键。Loughran和McDonald(2016)主张测量选择主导下游结论;我们的结果赋予该论点精确形式:两种已验证工具的选择会改变可恢复的时间结论。 #### 内在评估与外在评估 我们将“与人工标签一致性”和“与结果关联性”的区分对应于心理测量学中的构念效度与预测效度(Cronbach和Meehl, 1955),且该区分在NLP中存在先例:词表示的内在评估无法预测外在任务表现(Chiu等人, 2016),测量理论批评指出NLP系统常在未检验操作化指标所测量内容的情况下操作化构念(Jacobs和Wallach, 2021)。据我们所知,此前未有研究在同一组金融消息上同时进行两种评估——这使得第7节的局部时间跨度比较成为可能。 #### 金融文本中的LLM 大语言模型可从标题提取回报相关信号(Lopez-Lira和Tang, 2023),并在交易场景中优于Transformer与词典情绪工具(Kirtac和Germano, 2024);LLM标注可匹配或超越众包工人(Gilardi等人, 2023)。两个注意事项影响我们的设计:LLM情绪可能嵌入预训练窗口内的前瞻信息(Glasserman和Lin, 2023),这推动了第9节的污染分析,时序一致训练是建议的补救措施(He等人, 2025)。 #### 社交媒体、回报与证券诉讼 社交媒体情绪与市场运动的关联已确立(Bollen等人, 2011; Sprenger等人, 2014; Ranco等人, 2015),投资者分歧与交易量的联系也已验证(Cookson和Niessner, 2020);集体诉讼事件研究测量股东财富效应、诉讼风险和声誉损害,但未涉及社交媒体文本(Gande和Lewis, 2009; Kim和Skinner, 2012; Karpoff等人, 2008)。我们的场景以法院文件为事件锚点、携带最终法律结果,且评估测量工具本身而非单一工具的信号。新闻是已记录的欺诈检测渠道(Miller, 2006; Dyck等人, 2010),这与我们归因结果中新闻账号携带最强价格相关信号一致,也符合对领先成分的新闻到达解读。 ## 3 语料库与标注 ### 3.1 语料库构建 语料库包含三个队列的845起证券集体诉讼(表1):2024年与2025年的前瞻性队列,以及2002-2021年已结案的回顾性档案。法院文件提供公司身份、集体诉讼期边界、更正披露日期、指控摘要、被告及诉讼元数据。文件从PDF提取并转换为结构化记录。高价值字段(公司名称、股票代码、诉讼期边界、被告、披露日期)进行独立提取,分歧通过人工协调解决。这些日期定义消息检索与事件窗口。 表1:按队列划分的语料库。“社交”统计已收集消息的案件数;“消息”统计标注消息数。 ### 3.2 对话构成 本节标签分布由第3.4节描述的LLM工具生成。相关性、主题与极性分类体系在标注提示中固定(随代码与数据发布)。70,500条消息中,62.0%相关,20.3%边缘相关,17.6%为垃圾信息。主要话题包括新闻报道(13,880条)、律所营销(12,901条)、自动化垃圾信息(12,265条)、法律程序(9,658条)、股票分析(8,055条)及直接欺诈指控(7,835条)。极性方面,41.0%为负面,7.2%为正面。相关性与极性与人工标注高度一致(κ=0.746和0.741;第3.5节),而主题分类未经独立验证故仅作描述性使用。 基于计数的注意力指标将信息性报道、投资者反应、营销推广及自动化内容聚合成单一数值,这推动了第5节的比较分析。 ### 3.3 事件与市场关联 消息被分配至集体诉讼前期基线、指控集体诉讼期、更正披露窗口及披露后/立案后窗口,保留文本、时间戳、浏览量与点赞数(如可用)。对于公司i在日期t,用R_{i,t}表示实际回报,R_{m,t}表示市场回报。市场模型: R_{i,t} = α_i + β_i R_{m,t} + ε_{i,t} (1) 在集体诉讼期开始前十天结束的120个交易日上估计,因此参数仅使用事件前数据拟合。*异常回报*为当日回报中市场无法解释的部分: AR_{i,t} = R_{i,t} − (̂α_i + ̂β_i R_{m,t}), (2) 事件窗口W内的*累积异常回报*为其总和:CAR_i = Σ_{t∈W} AR_{i,t}。 ### 3.4 评分工具 五种工具对消息情绪进行评分:VADER(社交媒体词典,Hutto和Gilbert, 2014);Loughran-McDonald(金融词典,Loughran和McDonald, 2011);FinBERT与Twitter-RoBERTa(分别在金融新闻和推文上预训练的Transformer模型,Araci, 2019; Barbieri等人, 2020);Claude Haiku(LLM标注器)。工具输出不同,因此我们推导粗略与分级负面分数,数值越高表示情绪越负面。*粗略*分数忽略幅度:每条消息被分配至三类之一并映射为{+1, 0, −1}(+1为负面),Transformer与LLM使用预测类别,词典使用分数符号。*分级*分数保留幅度,取向为值越大越负面:VADER复合分数取反、Loughran-McDonald净负面词比率p(neg)−p(pos)、Transformer的p(neg)−p(pos)及LLM的−2到+2强度标签取反。 两种分数在每个案件日的消息上取平均。所有工具使用相同聚合与测试流程,但常规样本不同,因为...
相似文章
FinSMART:通过市场对齐的强化学习进行算法交易的金融情感分析
FinSMART引入了一种市场对齐的强化学习框架用于金融情感分析,利用实际市场结果优化情感信号,相比最强基线实现了累计交易回报220%的提升。
金融新闻自然语言处理中的时间泄漏:基于特定模式的并购信号的多架构审计
本文审计了多个模型在金融新闻自然语言处理基准中的时间泄漏,发现随机划分会夸大性能指标,并确定并购事件是在时序评估下具有局部正向信号的一个类别。
通过检索增强大型语言模型提升金融情感分析
本文介绍了一种检索增强的大型语言模型框架用于金融情感分析,相比传统模型及ChatGPT、LLaMA等大型语言模型,在准确率和F1分数上实现了15%至48%的提升。
统一多模态智能金融系统框架:整合强化学习、高频交易、博弈论方法与跨模态情感分析
本文提出了一种统一的多模态框架,融合强化学习、高频交易、博弈论方法及跨模态情感分析,用于构建智能金融系统,并声称相比单领域系统有显著提升。
通过高维表示学习弥合自然语言与市场动态之间的鸿沟
本文探讨了在基于Transformer的架构中,用高维FinBERT嵌入替换标量情感得分,用于短期股价预测,结果表明使用Siamese优化嵌入可提高准确性。