从数字到判断:面向欧洲上市房地产的专家型LLM智能体与强化学习
摘要
本文介绍了Larix,一个面向欧洲上市房地产分析的专家型LLM智能体框架,表明专家分解能提升数值任务表现,而强化学习(GRPO)能提升综合判断能力,且收益可迁移至未见过的公司与监管体系。
arXiv:2608.11381v1 公告类型:新论文
摘要:我们研究金融分析中的细粒度数值操作与综合判断是否受益于同一种LLM专业化形式。Larix将一个16视角的欧洲上市房地产分析框架映射为八个对齐视角的专家;我们在保持模型、源证据、任务指令、输出模式与评分标准不变的情况下,比较前沿LLM在整体式提示与专家分解式提示下的表现。在涵盖七种监管框架的19家公司中,分解使数值任务总分提高15.8个百分点,但在判断任务上并未稳定提升,甚至可能降低表现,这一模式在四次冻结模板调度中保持稳定;一个给定完整框架的单智能体对照组未复现数值收益。随后使用与任务对齐的结构化奖励对Qwen3.5-9B进行GRPO后训练,使开发集分数提高12.0分,判断总分提高14.2分,四项次天花板任务均获提升;收益可迁移至未见过的公司(总分+15.2分;契约压力测试+40.4分)以及未见过的监管框架(+4.3分),并在所有三个反记忆化划分上呈现正向迁移。因此,提示层面的分解改善了模块化数值执行,而针对性的参数适应改善了综合金融判断。
查看缓存全文
缓存时间: 2026/08/13 15:25
# 1引言 来源:https://arxiv.org/html/2608.11381 从数字到判断:面向欧洲上市房地产的专家LLM智能体与强化学习 Pardis Taghavi, Santosh Bhavani∗∗通讯作者:[santosh@ikmail\.com](mailto:[email protected]) 我们研究金融分析中的局部数值运算与整合判断是否受益于同一种LLM特化形式。Larix 将16视角的欧洲上市房地产分析框架映射到八个与视角对齐的专家;我们在保持模型、源证据、任务指令、输出模式与评分标准固定的情况下,比较前沿LLM在整体式提示与专家分解式提示下的表现。在跨越七个监管框架的19家公司中,分解使数值任务总分提高15.8个百分点,但并未可靠改善判断任务的表现,甚至可能降低其表现,这一模式在四次冻结模板派发中保持稳定;给单一智能体提供完整框架的控制条件无法复制数值上的收益。使用任务对齐的结构化奖励对 Qwen3.5-9B 进行 GRPO 后训练,使开发集分数提高12.0分,判断任务总分提高14.2分,所有四个亚天花板子任务均有增益;这些增益可迁移到未见过的公司(总体+15.2分;契约压力任务+40.4)和未见过的监管框架(+4.3),并且在所有三个反记忆化划分上均呈现正向迁移。因此,提示层面的分解改善了模块化数值执行,而针对性的参数适应则改善了整合性金融判断。 ## 1 引言 欧洲上市房地产是一种收益型资产类别,其规则会随司法辖区的变化而改变。法国 SIIC 必须依法分配其大部分经常性收益;Aroundtown 是一家注册于卢森堡、主要管理德国和荷兰物业的房东企业,它没有法定的分配义务,也没有派发 FY2024 股息;而经常性绩效的正确计量方式则在 EPRA Earnings、FFO I 以及剔除重估后的每股收益之间切换[4 (https://arxiv.org/html/2608.11381#bib.bib4),6 (https://arxiv.org/html/2608.11381#bib.bib6),10 (https://arxiv.org/html/2608.11381#bib.bib10)]。因此,股息可持续性判断、契约头寸以及估值都依赖于在任何数字计算之前做出的一个分类判断:该公司受哪套法律与报告制度管辖。将一套制度的规则应用于另一家制度下的公司,不是近似错误,而是自信的、机械式的错误。语言模型智能体也面临同样的陷阱:它们可以从正确的文件中提取出正确的数字,却仍然应用错误制度下的规则,而且其输出的流畅性使得错误难以察觉。因此,这一场景暴露了金融LLM面临两种截然不同的需求:模块化数值操作(例如提取符合制度要求的指标或执行既定计算),以及整合判断(即协调会计、监管和风险维度的证据)。 专家分解是对这种异质性的自然回应,但其效果未必在这两种需求上保持一致。将模型限制在狭窄的分析视角可以减少不相关的上下文,并使必需的中间字段显式化,这应有助于局部数值执行;而整合判断则需要在披露和分析视角之间组合证据,将这些证据分割给不同专家可能不会带来收益:狭窄的提示范围可能会遗漏跨视角证据,而这类证据正是整合决策所需要的。现有的金融多智能体系统展示了基于角色的工作流和端到端决策流水线[20 (https://arxiv.org/html/2608.11381#bib.bib19),23 (https://arxiv.org/html/2608.11381#bib.bib22),24 (https://arxiv.org/html/2608.11381#bib.bib23)],但其报告的收益混淆了分解本身与额外的领域指令及模型差异。因此,我们要问:专家分解何时能改进固定前沿LLM,这种干预何时失败,以及任务对齐的后训练能否在本质上更小的模型上,使其整合性金融判断超越其零样本行为。 我们通过 Larix 来研究这些问题。Larix 将16视角欧洲上市房地产分析框架映射到八个具有结构化输出的视角对齐专家;本文的经验单元是专家层,下游的综合、信念校准和仓位规模设置不在当前评估范围内。为了隔离分解本身的效果,我们在使用相同前沿模型的条件下比较三种情形:整体式金融分析提示、告知完整16视角框架的整体式提示,以及视角对齐的专家提示;三种情形共享相同的源证据、任务指令、输出模式和每个任务内的评分标准。该基准将基于源证据的数值任务与需要协调多个披露和制度特定约束的判断密集型任务区分开来。此外,我们还使用任务对齐的结构化奖励对 Qwen3.5-9B 进行 GRPO 优化,并在相同的留出基准上评估零样本和后训练检查点。 在跨越七个监管框架的19家公司中,分解使数值任务总分提高15.8个百分点,而在主要派发中判断任务总分保持不变;完整框架的整体式控制在提取任务上的得分低于通用整体式提示,因此是聚焦的视角所有权而非框架披露带来了增益。随后,GRPO 后训练使 9B 模型在开发集上的判断任务总分提高14.2分,且这些增益可迁移到未见过的公司、未见过的监管框架以及更晚的期间,其中最大的分布外增益出现在契约压力判断任务上(第5节 (https://arxiv.org/html/2608.11381#S5))。这些结果表明了一种任务相关的分工:提示层面的分解改善模块化数值执行,而针对性的参数适应则改善整合性金融判断。 #### 贡献。 我们做出四点贡献。第一,我们对视角对齐的专家分解在制度感知金融分析中的效果进行了受控的同模型评估,保持源证据、任务指令、输出模式和评分固定,并加入了完整框架的整体式控制。第二,我们识别出一个任务相关的权衡:分解改善了模块化数值分析,但并未可靠改善、甚至可能降低需要整合性金融判断的任务的表现。第三,我们针对同一分析界面开发了一种结构化奖励 GRPO 后训练流程,并证明后训练的 Qwen3.5-9B 改善了提示层面分解无法改善的判断任务,且增益可迁移到未见过公司和未见过监管框架。第四,我们发布了这些发现背后的评估资产:一个包含25家公司、八个监管框架的基准,涵盖基于源证据的数值任务和判断任务,并带有修正后的逐格出处评分规则、冻结的重复派发面板以及加固的评分工具。 ## 2 相关工作 #### 金融LLM与多智能体系统。 相关文献已从指令微调的通识模型[19 (https://arxiv.org/html/2608.11381#bib.bib18)]演进到角色特化的多智能体架构[5 (https://arxiv.org/html/2608.11381#bib.bib5),20 (https://arxiv.org/html/2608.11381#bib.bib19),23 (https://arxiv.org/html/2608.11381#bib.bib22),24 (https://arxiv.org/html/2608.11381#bib.bib23),25 (https://arxiv.org/html/2608.11381#bib.bib24),16 (https://arxiv.org/html/2608.11381#bib.bib27)],其中来自软件工程的多智能体设计[7 (https://arxiv.org/html/2608.11381#bib.bib7),8 (https://arxiv.org/html/2608.11381#bib.bib8)]在编排者加专家拓扑以及结构化消息传递的框架下影响了金融部署[22 (https://arxiv.org/html/2608.11381#bib.bib21)]。Larix 的不同之处在于,它将专家范围锚定到一个显式的领域框架,并将专家层而非端到端流水线作为强化学习优化的单元。 #### 评估与上市房地产领域。 金融自然语言处理评估已从财务报告上的数值推理[2 (https://arxiv.org/html/2608.11381#bib.bib2)]演进到基于原始文档的开卷问答[9 (https://arxiv.org/html/2608.11381#bib.bib9)]以及整体性多任务套件[21 (https://arxiv.org/html/2608.11381#bib.bib20)]。有两个教训与我们的设计直接相关:基准分数取决于提示与评分的协议(我们的工具加固发现即附录A.1 (https://arxiv.org/html/2608.11381#A1.SS1)的一个实例);而链式思考分解[18 (https://arxiv.org/html/2608.11381#bib.bib17)]是专家条件必须击败的信息性基线。上市房地产文献确立了我们的任务所编码的经验规律:FFO 相较于 GAAP 净利提供增量信息含量[17 (https://arxiv.org/html/2608.11381#bib.bib16)];上市房地产股票交易价格相对于 NAV 持续存在折价和溢价[1 (https://arxiv.org/html/2608.11381#bib.bib1)];监管结构与派息要求与跨国绩效相关[6 (https://arxiv.org/html/2608.11381#bib.bib6)];而盈余类与 FFO 类指标之间的选择在经验上尚有争议[10 (https://arxiv.org/html/2608.11381#bib.bib10)]。我们的基准与这些评估套件的不同在于,它覆盖八个欧洲监管框架的跨制度比较,采用确定性评分规则对照专家盲审的真实值,并且在保持底层模型固定不变的条件下评估各条件。 #### LLM的RL后训练。 LLM的强化学习微调已从人类反馈对齐[12 (https://arxiv.org/html/2608.11381#bib.bib12)]演进到采用组相对目标的结果奖励推理后训练[3 (https://arxiv.org/html/2608.11381#bib.bib3),14 (https://arxiv.org/html/2608.11381#bib.bib14),26 (https://arxiv.org/html/2608.11381#bib.bib25)],诸如 veRL[15 (https://arxiv.org/html/2608.11381#bib.bib15)]这样的开放框架支持大规模 GRPO 式后训练。领域应用也随后出现:近期的金融推理模型在混合金融问答语料上对整体式 7B 骨干进行监督微调后接 GRPO 后训练[11 (https://arxiv.org/html/2608.11381#bib.bib11),27 (https://arxiv.org/html/2608.11381#bib.bib26)]。我们在此基础上进一步发展,但针对同一确定性评分规则对视角对齐的金融专家进行后训练,从而能够在相同任务上直接比较提示层面与参数层面的特化。 ## 3 方法 ### 3.1 任务定义 对于每个评估实例 $i$,令 $$x_{i}=(d_{i},q_{i},t_{i},\mathcal{Y}_{t_{i}}),$$(1) 其中 $d_{i}$ 是提供给该公司的原始证据,$q_{i}$ 是任务指令,$t_{i}$ 标识任务,$\mathcal{Y}_{t_{i}}$ 是其结构化输出模式。目标 $y_{i}^{\star}\in\mathcal{Y}_{t_{i}}$ 来自第4节 (https://arxiv.org/html/2608.11381#S4) 中预先承诺的真实值协议。 我们将基准分为两类任务。数值任务 $$\mathcal{T}_{\mathrm{num}}=\{T1,T3,T6\}$$ 需要局部提取或确定性计算:提取符合制度规定的经营指标、计算隐含资本化率,或者从已披露的分配和该框架的法定规则中机械地推导出派息制度。判断任务 $$\mathcal{T}_{\mathrm{judg}}=\{T2,T5\}$$ 需要组合多个字段或披露信息以产生结构化分类或契约评估。这一区分在评估分解效果之前就已固定。 对于给定实例,所有被比较的条件都接收相同的源证据、任务指令、输出模式和生成设置。干预只改变分析框架呈现给模型的方式,以及任务是否被分配给某个专家提示。 ### 3.2 视角对齐的专家分解 Larix 将16个分析视角分配给八个专家:财务、资产质量、管理、估值、宏观叠加、催化剂、做空与筛选来源。每个视角对应一个明确的披露或推断操作,而非通用角色。一个确定性路由器 $$r:\mathcal{T}\rightarrow\mathcal{A}$$(2) 将每个任务 $t$ 映射到拥有相应视角的专家 $r(t)$。 当前基准使用了八个专家中的三个:财务(负责 T1、T2 和 T6)、资产质量(负责 T3)和宏观叠加(负责 T5)。每个基准项恰好调用一个专家智能体。专家在本评估期间不交换消息,下游综合智能体也不被调用。因此,实验测试的是视角对齐的专家智能体分配的效果,而非跨智能体协作或端到端信念综合。 表1:所评估专家层中的任务到专家映射。更广泛的 Larix 架构包含八个专家,但五项任务基准只使用了这里展示的三个。 令 $f_{\theta}$ 表示固定的前沿模型。我们评估三种提示条件: $$\hat{y}^{\mathrm{mono}}_{i}=f_{\theta}\left(p_{\mathrm{mono}}\oplus x_{i}\right),$$(3) $$\hat{y}^{\mathrm{full}}_{i}=f_{\theta}\left(p_{\mathrm{full}}\oplus x_{i}\right),$$(4) $$\hat{y}^{\mathrm{spec}}_{i}=f_{\theta}\left(p_{r(t_{i})}\oplus x_{i}\right).$$(5) 这里,$p_{\mathrm{mono}}$ 是通用的金融分析系统提示,$p_{\mathrm{full}}$ 为单一模型调用披露完整的16视角框架,而 $p_{r(t_{i})}$ 只包含分配给所选专家的那部分视角。第一种和第三种条件在模型规模固定的情况下隔离出专家分解的效果。第二种条件则测试仅披露更多框架内容是否就能带来任何增益。 ### 3.3 结构化输出与评分接口 每个条件都必须返回相同的任务特定 JSON 模式。该模式只包含提示中明确要求、并由评分器评估的字段。这种对齐避免了模型因未被要求生成的字段而受到惩罚。 对于任务 $t$,令 $\mathcal{J}_{t}$ 表示其得分字段的集合。确定性任务分数为 $$S_{t}(\hat{y}_{i},y_{i}^{\star})=\mathbf{1}[\hat{y}_{i}\text{ is valid}]\sum_{j\in\mathcal{J}_{t}}w_{t,j}\,s_{t,j}\left(\hat{y}_{i,j},y_{i,j}^{\star}\right),$$(6) 其中 $$\sum_{j\in\mathcal{J}_{t}}w_{t,j}=1.$$(7) 这里,$s_{t,j}\in[0,1]$ 是预先指定的字段评分器,$w_{t,j}$ 是其固定权重。数值字段使用评估前固定的公差或归一化误差规则。类别字段在经过文档化的别名归一化后使用精确匹配。复合判断输出(如契约类型、单位、阈值和违约状态)按照预先声明的联合字段规则进行评分。无效或不可解析的输出得零分。
相似文章
智能体交易:当LLM智能体遇上金融市场
本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。
@DanKornas: 单个LLM可以将市场数据、讨论和风险模糊成一个不透明的答案。这个仓库将工作分散到专门的……
TradingAgents 是一个开源的金融分析多智能体LLM框架,将市场数据通过专门的智能体进行路由以进行研究。
工具增强型LLM代理在实际能源分析任务中的表现如何?
本文介绍了一项实证研究和基准测试,用于评估工具增强型LLM代理在实际能源分析任务上的表现,包含243个由专家策划的问题,涵盖市场数据检索、知识解读和定量建模。
从受训者到训练者:LLM为多智能体推理强化学习设计的训练环境
本文介绍了LLM-as-Environment-Engineer框架,该框架使LLM能够为多智能体推理任务中的强化学习设计自己的训练环境,实现自我改进训练,其性能超越更大的专有模型。
@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…
JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。