MacroLens:宏观经济场景下上下文金融推理的多任务基准

arXiv cs.LG 论文

摘要

MacroLens 是一个用于上下文金融推理的新型多任务基准,它联合评估了价格历史、会计基本面、宏观经济体制以及文本数据,覆盖 4,416 只美国小盘股和微盘股。该基准包含七个任务、1,130 个宏观经济事件,并对 19 种方法进行了评估,旨在填补金融 AI 评估中的空白。

arXiv:2606.24950v1 公告类型:新 摘要:金融决策具有上下文特性:预测价格、评估公司价值以及判断事件影响都需要综合考虑价格历史、会计基本面、宏观经济体制以及当时的文本信息。构建一个涵盖这四种信号的基准难度很大,因为金融领域违背了时间序列评估的四个假设:文本必须按其发布日期进行筛选以防止前瞻性偏差;季度基本面数据的报告存在一到九十天的滞后;与文本一起提交的数值字段存在部分冗余;宏观经济体制在日历分割中会泄露信息。目前尚无公开基准能同时处理这四种信号。MacroLens 覆盖了 2021-2026 年间 4,416 只美国小盘股和微盘股。七个任务共享同一个时间点面板数据,包括价格、4680 万条 XBRL 会计事实、53 个宏观经济序列、295,860 份 SEC 文件以及 215,882 篇新闻文章,此外还有一个场景层,包含 1,130 个宏观经济事件(自动检测并呈现为自然语言的 49 种类型)。任务涵盖上下文预测、公共与私人估值、基于基本面和描述生成报表、场景条件回报以及房地产估值。我们评估了 19 种方法,涵盖六个系列,从朴素启发式到时序基础模型、微调后的基于 LLM 的时序模型、零样本大语言模型(LLM),以及两个前沿 LLM 的五步特征上下文消融和梯度提升基线。MacroLens 发布在 https://huggingface.co/datasets/DeepAuto-AI/MacroLens。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:07

# MacroLens:宏观情景下上下文金融推理的多任务基准

来源:https://arxiv.org/html/2606.24950

Patara Trirat¹, Jin Myung Kwak¹,², Jay Heo¹, Heejun Lee¹,², Sung Ju Hwang¹,²

¹DeepAuto.ai, ²KAIST

{patara, jinmyung, jawook, ain, sjhwang}@deepauto.ai

首尔,韩国

###### 摘要

金融决策具有上下文相关性:预测价格、估值公司以及评估事件暴露程度,需要综合考虑价格历史、会计基本面、宏观制度以及同期文本。构建一个涵盖这四种信号的基准很困难,因为金融违反了时间序列评估的四个假设:文本必须根据其发布日期进行门控以防止前瞻偏差,季度基本面数据报告存在一到九十天的滞后,申报文件文本与其附带的数值报表字段部分冗余,且宏观制度会跨日历分割泄露。目前尚无公开基准能同时处理所有四种信号。

MacroLens 覆盖了2021–2026年间4,416只美国小型和微型市值股票。七个任务共享同一个时间点面板,包含价格、4680万XBRL会计事实、53个宏观序列、295,860份SEC申报文件和215,882篇新闻文章,以及一个包含1,130个宏观事件(跨越49种类型,自动检测并以自然语言描述)的情景层。任务涵盖上下文预测、公开和私人估值、基于基本面和描述生成财务报表、情景条件收益预测以及房地产估值。我们评估了19种方法,涵盖六个系列,从朴素启发式到时间序列基础模型、微调LLM时间序列模型以及零样本大语言模型(LLM),并对两个前沿LLM和一个梯度提升基线进行了五步特征上下文消融实验。MacroLens 发布在 https://huggingface.co/datasets/DeepAuto-AI/MacroLens。

## 1 引言

见图1

**左图**:MacroLens 相对于现有基准的定位。**右图**:在锚定日期 t 的一个 MacroLens 实例,展示了四种输入类型以及基于相同证据推导出的七个任务。

财务决策需要综合权衡四种信号:价格历史、会计基本面、宏观制度以及同期文本。从业者在判断一家小盘股能否挺过美联储紧缩周期时,会阅读其10-K报告、关注消费者价格指数(CPI)发布、将其与同行业进行比较,并权衡各个信号的相对重要性。

没有任何公开基准要求模型完成同样的任务。

通用时间序列基准要么忽略文本,要么提供非金融文本(Godahewa等,2021;Qiu等,2024;Aksu等,2024;Williams等,2025)。金融语言基准评估分类、情感和文档理解,而非基于基本面和宏观状态的时间性预测(Xie等,2023;2024)。多模态预测基准报告了较大的文本上下文增益(方向准确率提升22–29个百分点(Jang等,2026),连续排名概率评分降低67%(Williams等,2025)),但仅限于非金融或部分合成数据(Williams等,2025;Kim等,2024;Liu等,2024a)。这些增益在真实财务决策中是否成立仍有待验证。

金融违反了现有时间序列基准中嵌入的四个假设。

申报文件和新闻只有在发布后才可用,且通常远晚于其所描述的事件:对于12月财政年度末的10-K报告,会在次年2月或3月提交。如果根据报告内容日期而非提交或发布日期来附加此类文本,则会在其公开之前就暴露给模型,因此文本输入必须根据其发布或提交日期进行门控。季度基本面数据报告存在一到九十天的滞后,因此在日历时间t观察到的特征在决策时间t可能尚不可知。申报文本具有领域特异性,且与其附带的数值报表字段部分冗余,因此多模态模型无法在不进行联合构建的情况下与单模态模型进行公平比较。宏观制度具有持久性和局部相关性,因此尊重日历时间的时间顺序分裂仍然会在训练集和测试集之间泄露制度结构。

一个金融基准必须在构建时而非评估时处理所有这四个约束。MacLens 在2021-01-04至2026-03-31期间针对4,416只美国小型和微型市值股票解决了这些约束。七个任务共享同一个时间点面板,包含价格、可扩展商业报告语言(XBRL)会计事实、联邦储备经济数据(FRED)和能源信息管理局(EIA)宏观序列、美国证券交易委员会(SEC)申报文件以及金融新闻。一个包含1,130个宏观事件(跨越49种类型)的情景层从宏观面板中自动检测并以自然语言描述(图1右)。每个文本输入都根据其发布或提交日期进行门控,表格基本面数据携带截至t最近报告期内按报告数值,宏观序列按其参考日期对齐。任务涵盖上下文时间序列预测、公开和私人估值、财务报表生成、情景条件收益预测、基于自然语言描述的报表生成以及房地产估值。

其中三个任务——私人公司估值、基于自然语言描述生成报表以及房地产估值——针对私募股权(PE)和风险投资(VC)实践中的核心能力,而这些在以往的金融基准中没有对应项(Xie等,2023;2024;Hu等,2025;Jiang等,2026;Sugiura等,2026)。MacroLens 占据了时间基础与多模态上下文的交叉点,这是以往基准所未覆盖的(图1左)。

我们的贡献如下。

- •我们引入了 MacroLens,这是第一个要求模型在时间点面板上联合推理价格历史、基本面、宏观制度以及公司层面文本的基准,覆盖4,416只美国小型和微型市值股票,包含七个任务——其中三个是金融基准中的新任务:私人公司估值、基于自然语言生成报表以及房地产估值。
- •我们在构建时强制执行四个构建不变量以防止评估泄露,并增加了用于情景条件评估的情景层。
- •我们对19种方法(跨六个系列)进行了基准测试,并对两个前沿LLM和一个梯度提升基线进行了五步特征上下文消融实验。
- •

## 2 相关工作

通用时间序列基准标准化了跨领域的实证比较,并提供了时间序列基础模型(如Chronos(Ansari等,2024)、Moirai(Woo等,2024;Liu等,2025)和TimesFM(Das等,2024))背后的语料库;例子包括Monash(Godahewa等,2021)、TFB(Qiu等,2024)和面向基础模型的GIFT-Eval(Aksu等,2024)。这些资源是单模态的:没有一个测试模型是否基于时间对齐的文本、宏观情景描述或估值相关证据进行条件化。MacroLens 在保持预测作为主要任务的同时增加了这些条件化通道。

第二项工作是将上下文作为显式输入。CiK(Williams等,2025)、Time-MMD(Liu等,2024a)、TimeText Corpus(Kim等,2024)和SciTS(Wu等,2026)将数值序列与文本配对,而WIT(Jang等,2026)评估了替代未来情景下的方向预测。这些基准涵盖天气、零售和科学领域,而非公司层面的金融,并且它们孤立地评估预测,不涉及估值。在金融领域内,事件研究方法(MacKinlay,1997)和制度切换模型(Hamilton,1989)长期以来一直基于检测到的事件或潜在制度进行条件预测;MacroLens 将这种条件化引入基准评估的多模态设置中。我们对聚类观测值的统计推断遵循Cameron等人(2008)的聚类自助法构建。

MacroLens 在同一个实例上放置了宏观情景推理和估值,这种组合在以往的多模态基准中不存在。

金融基准在申报文件的语言理解和推理方面取得了进展,包括PIXIU(Xie等,2023)、FinBen(Xie等,2024)和Fin-RATE(Jiang等,2026),但它们评估的是静态文档推理,而非基于时间的预测。更接近我们的设置,FinTSB(Hu等,2025)提供了大规模股票预测但缺乏上下文文本,而EDINET-Bench(Sugiura等,2026)将申报文件与三个分类任务配对;其他多模态金融工作是模型特定(Koval等,2024;2025;Chen等,2024)而非基准中心的。

表1将 MacroLens 与这些基准在预测、文本输入、情景条件化、估值覆盖和多粒度轴上进行定位。MacroLens 在一个统一的评估框架内统一了数值历史、公司层面文本和检测到的宏观事件,涵盖预测、估值和报表生成。

表1:MacroLens 与相关基准的定位。我们报告了引用论文本机单位中的*范围*行;行之间仅在分类列上具有直接可比性,而非*范围*列。“N/A”在*多粒度*列中标记纯NLP基准,其时间粒度未定义。

## 3 背景与问题设定

令 T 索引一个包含4,416个代码的集合,令 g ∈ {daily, weekly, monthly} 索引粒度。对于每个 (i, t, g),其中代码 i ∈ T,时间戳 t(评估实例的锚定日期),我们观察到一个数值特征向量 x_{i,t,g} ∈ R^{131}(来自141列面板,其余10列为非特征标识符和日期字段)、可选静态协变量 z_i、可选情景对象 s_t(类型加自然语言渲染)以及可选的来自申报文件或新闻的文本上下文 u_{i,≤t};下面的 x_{i,t-L:t,g} 表示截至t的长度为L的特征回顾窗口。一个 MacroLens 实例是元组 ⟨i, t, g, x_{i,t-L:t,g}, z_i, s_t, u_{i,≤t}⟩,与一个特定任务的目标 y_{i,t} 配对。将任何可选输入设置为 ∅ 产生自然的模态消融。预测任务按时间顺序分割评分;估值和生成任务按公司级留出评分;房地产任务按地址级留出评分。第4.7节详细说明了每个任务的 y。

**时间点对齐**。x_{i,t,g} 的每个坐标、z_i 中的每个协变量、每个情景 s_t 以及 u_{i,≤t} 中的每个文本摘录在 t 时刻都是可观察的。第4.5节详细说明了操作执行。

**代数泄露**。对于公开和私人估值任务,目标是实现市值。在排除每个目标的代数函数列后,剩余特征-目标的最大Pearson相关系数为流通股数(ρ ≈ 0.3),这是一个合理的规模代理变量。

## 4 MacroLens 基准

见图2

图2:MacroLens 构建流水线:股票池定义、按源摄入、四个构建时不变量、面板和情景组装,以及每个任务的真实值构建。

MacroLens 将包含4,416家公司的多模态时间点面板与自动提取的宏观情景层相结合,并定义了七个评估任务(第4.7节)。单一面板设计支持对同一公司的配对对比:公共公司与私人公司估值隔离了衍生估值比率特征的价值;基于数值基本面与基于自然语言描述的报表生成隔离了文本的贡献;收盘价与情景条件收益预测共享回顾窗口,后者增加了情景条件化文本。单独策划的任务文件无法支持这些对比。四个构建时不变量的构建强制执行时间点纪律(第4.5节),图2展示了端到端流水线。

### 4.1 组成:2021–2026年4,416只美国小型和微型市值股票,三种粒度

MacroLens 是一个从2021-01-04到2026-03-31的时间点多模态面板,覆盖4,416只美国小型和微型市值股票,跨越一个完整的宏观周期:疫情复苏、2022–2023年美联储紧缩以及2024–2026年宽松转向。股票池结合了罗素2000指数、标普小型股600指数、iShares微型股指数以及上述三个指数未覆盖的纳斯达克小型股,并且仅对非指数来源应用了74亿美元的上限市值约束,而指数成分股则按其公布的上限包含。我们未设置下限,因此面板刻意包含了小型股和微型股。市值范围大约从50万美元到412亿美元,其中67.5%的公司低于10亿美元,30.8%位于10亿至74亿美元的小型股区间。在4,416个代码中,3,857家为运营公司,333家为基金,226家为特殊目的收购公司(SPAC)。我们包含那些在N-CSR表格上报告(SEC认证的注册投资公司年度股东报告)的基金,因为它们与运营公司共享小型股估值环境,并为报表生成任务提供了有意义的应用掩码对比,其报告节奏与运营公司的XBRL申报不同。每个代码都

相似文章