关系基础模型中的上下文窗口限制
摘要
本文评估了关系基础模型在高基数数据上的表现,揭示了上下文窗口限制导致性能下降,而通过简单的预聚合步骤可以缓解。
查看缓存全文
缓存时间: 2026/09/02 06:14
# 关系型基础模型中的上下文窗口失效问题 来源:https://arxiv.org/html/2609.00460 Francisco Galuppo Azevedo 所属机构:Kunumi Institute, Brazil 所属机构:Universidade Federal de Minas Gerais, Belo Horizonte, Minas Gerais, Brazil 通讯作者:[franciscogaluppo@dcc\.ufmg\.br](mailto:[email protected]) ###### 摘要 近期,关系型深度学习架构被提议作为多表关系数据的基础模型,但它们强制施加了受限的邻域预算,导致当实体拥有大量关联记录时必须截断行数据。本文引入 Animus,一个合成金融数据集,其中预测客户收入需要聚合多达数万条交易记录。在原始表示下,三个近期提出的模型(RT、Griffin、RelGT)的 R² ≤ 0.18;而仅通过一个常规的、时序性的预聚合步骤,R² 即可恢复至 0.65。这一结果对当前关系型基础模型是否已为高基数现实世界数据做好了准备提出了质疑。 ###### 关键词: 机器学习,关系型基础模型,上下文窗口 ## 1 引言 关系型数据库是工业界占主导地位的数据格式,支撑着从欺诈检测到信用评分等多种应用。此类数据上的预测任务需要跨多个实体和事件表进行连接与聚合,这一场景一直抵制着基础模型在语言和视觉领域已实现的统一建模。Robinson 等人 (2024) (https://arxiv.org/html/2609.00460#bib.bib1) 将这一挑战形式化为一个基准测试,从而催生了一批声称实现了关系数据基础模型地位的架构。 所有三个近期提出的基础模型架构都对每个实体可纳入的行数施加了硬性限制。关系型 Transformer (RT) (Ranjan et al., 2026 (https://arxiv.org/html/2609.00460#bib.bib3)) 受限于上下文大小;关系图 Transformer (RelGT) (Dwivedi et al., 2026 (https://arxiv.org/html/2609.00460#bib.bib2)) 受限于其子图采样预算;Griffin (Wang et al., 2025 (https://arxiv.org/html/2609.00460#bib.bib4)) 则受限于其每跳扇出度。在所有情况下,超出预算的行/单元格都会被丢弃。然而,在现实世界的关系数据中,高频实体积累的记录数量可能比这些预算允许的多出数个数量级。这一差距尚未经过压力测试。 我们引入 Animus,一个旨在精确压力测试此限制的合成金融数据集。客户交易频率具有异质性:60% 的客户为领薪阶层,每月大约产生一笔交易;而 5% 为高交易量客户,每月产生一千到一万笔交易。我们在同一数据的两种表示(原始单条事件和简单的月度聚合)上评估了 RT、Griffin、RelGT 和 GraphSAGE (Hamilton et al., 2017 (https://arxiv.org/html/2609.00460#bib.bib5)),发现三个受预算限制的模型在获得预聚合输入时,R² 最多可恢复 +0.47;而采用更大采样预算的 GraphSAGE 在原始数据上已表现良好,仅提升了 +0.06。 本文其余部分组织如下。第 2 节 (https://arxiv.org/html/2609.00460#S2) 回顾所评估的模型。第 3 节 (https://arxiv.org/html/2609.00460#S3) 描述 Animus 和预测任务。第 4 节 (https://arxiv.org/html/2609.00460#S4) 展示结果与分析。第 5 节 (https://arxiv.org/html/2609.00460#S5) 讨论其意义。数据集生成代码和模型配置将在论文接收后公开。 Customerscustomer\_id, age, region, income\_range Transactions transaction\_id, customer\_id, date, amount, category, type Payments payment\_id, customer\_id, date, amount, type, status NN:1 1 图 1:Animus 的关系模式。 ## 2 背景 关系型深度学习范式由 Fey 等人 (2024) (https://arxiv.org/html/2609.00460#bib.bib6) 形式化,将关系数据库表示为异质时序图:每一行是一个节点,外键关系是有向边。任务在实体级别定义并在固定时间戳评估,因此每个模型必须聚合来自图中实体邻域的信息。我们评估四个模型: - • GraphSAGE (Hamilton et al., 2017 (https://arxiv.org/html/2609.00460#bib.bib5)) 是一个邻域聚合图神经网络 (GNN),在采样邻居上应用排列不变的聚合器(求和)。 - • RT (Ranjan et al., 2026 (https://arxiv.org/html/2609.00460#bib.bib3)) 是一个基础模型,通过掩码 token 预测进行预训练,它将数据按单元格分词,并沿三个轴应用注意力:按行(跨记录)、按列(跨特征)以及跨主-外键链接;单元格数量受限于 `seq_len`。 - • Griffin (Wang et al., 2025 (https://arxiv.org/html/2609.00460#bib.bib4)) 是一个以图为中心的 GNN,通过具有小每跳扇出度的消息传递传播信息。 - • RelGT (Dwivedi et al., 2026 (https://arxiv.org/html/2609.00460#bib.bib2)) 利用图结构采样一个子图,用元数据(类型、跳数距离、时间、局部结构)丰富每个采样节点,并通过具有局部和全局注意力的 transformer 处理得到的 token。 所有三个受预算限制的模型都会丢弃超出其限制的记录,无论这些记录可能包含多少信息。GraphSAGE 在更大但仍有限的采样预算下运行,在足够极端的基数下性能也会下降。我们提出的问题是:当前架构施加的预算对于现实世界的关系数据是否不足。 ## 3 方法 Animus 是一个合成金融数据集,包含 M=100,000 名客户。客户注册时间分布在 2023 年 1 月至 2024 年 1 月;每个客户从其注册日期起累积十二个月的交易历史。数据库包含三个通过 `customer_id` 链接的关系表:Customers、Transactions 和 Payments(图 1 (https://arxiv.org/html/2609.00460#S1.F1))。由于一小部分客户每月产生数千笔交易,总交易量达到数千万行;节点计数统计在附录 D (https://arxiv.org/html/2609.00460#A4) 中报告。 ### 预测任务 该任务是在 RelBench 框架 (Robinson et al., 2024 (https://arxiv.org/html/2609.00460#bib.bib1)) 内定义的实体级收入回归。给定截至预测时间戳 `t` 的所有数据,模型必须估计每个客户在 `t` 之后一个月的总信贷收入。我们使用三个时序划分:训练集截止 2024-03-31,验证集截止 2024-06-30,测试集截止 2024-09-30。在预测时,`t` 之后的任何交易都不可见。 ### 客户收入 每个客户 `i` 被分配一个月基础收入 `y_i^base ∈ {$1,000, $2,000, $3,000}`,概率分别为 `(0.50, 0.35, 0.15)`。月收入并非恒定,客户十二个月内的总收入根据四种时序收入模式之一分配到各月,模式在注册时分配: - • 均匀 (50%):所有十二个月权重相等; - • 后置 (20%):最后四个月权重为 `(0.1, 0.2, 0.3, 0.4)`,其他月份为零; - • 前置 (15%):前四个月权重为 `(0.4, 0.3, 0.2, 0.1)`,其他月份为零; - • 中峰 (15%):中间两个月权重为 0.5 和 0.3,其他所有月份为 0.05(然后归一化)。 令 `y_i(m)` 表示客户 `i` 在第 `m` 月的真实收入;预测目标是 `y_i(m+1)`。 ### 信贷交易 每个客户在注册时被分配一个交易频率类别(图 2 (https://arxiv.org/html/2609.00460#S3.F2)): - • 单笔 (60%):每月恰好 1 笔信贷; - • 低频 (25%):`K_i(m) ~ U[4, 10]` 笔信贷/月; - • 中频 (10%):`K_i(m) ~ U[100, 1,000]`; - • 高频 (5%):`K_i(m) ~ U[1,000, 10,000]`。 图 2:每位客户的交易计数分布(对数刻度)。 在月份 `m` 内,`K_i(m)` 笔单独的信贷金额通过抽取权重向量 `w ~ Dirichlet(1_K)` 并设置每笔金额为 `w_k · y_i(m)` 生成,因此该月的信贷总额恰好等于 `y_i(m)`。交易类别取决于类别:*单笔*从 {salary, freelance} 中抽取,概率为 `(0.8, 0.2)`;*低频*从 {salary, freelance, bonus} 中抽取,概率为 `(0.5, 0.4, 0.1)`;*中频*和*高频*均匀抽取自所有五个类别 {salary, freelance, bonus, refund, transfer_in}。由于目标 `y_i(m+1)` 等于所有 `K_i(m+1)` 笔信贷金额之和,仅观察到其中 `k < K_i(m+1)` 笔的模型获得的期望估计值为 `y_i(m+1) · k / K_i(m+1)`,这是一个随 `K_i(m+1)` 增加而恶化的低估值。这正是该基准测试的核心对抗属性。 ### 借记交易 每个客户每月接收 `D_i(m) ~ U[5, 24]` 笔借记交易,与频率类别无关,当月度借记预算使该数量交易不可行时则向下截断。每个客户的余额比率 `ρ_i` 在注册时从三种状态之一抽取一次: - • 平衡:`ρ_i ~ U[0.95, 1.05]` (35%); - • 亏损:`ρ_i ~ U[1.10, 1.50]` (15%); - • 盈余:`ρ_i ~ U[0.40, 0.90]` (50%)。 整个任期的总借记额等于 `ρ_i · Σ_m y_i(m)`,通过抽取 `U[0.7, 1.3]` 的乘数并归一化分配到各月。单笔借记金额按顺序采样,受月度预算约束,区间概率为:小额 $5–$100 (60%),中额 $100–$500 (30%),大额 $500–$5,000 (10%)。支出类别根据实现金额分配: - • 超过 $1,000:{rent 60%, shopping 30%, healthcare 10%}; - • $200–$1,000:{shopping 40%, utilities 30%, entertainment 20%, transportation 10%}; - • 低于 $200:{groceries 40%, dining 30%, transportation 20%, shopping 10%}。 ### 支付 均匀随机的 30–40% 客户拥有支付记录,代表偿债义务(贷款、抵押贷款、信用卡)。每个此类客户有 `U[50, 599]` 笔支付事件,金额从 `LogNormal(μ=log 1,700, σ=0.8)` 中抽取并截断至 [$50, $5,000],类型均匀抽取自 {loan, credit_card, mortgage, auto_loan},日期在其整个任期内均匀抽取。支付不属于收入标签的一部分,也不携带任何预测信号:支付客户是均匀随机选择的,不以收入为条件,支付金额从独立于 `income_range` 的固定分布中抽取。它们仅为关系模式增添现实性。 ### 两种表示 我们在同一基础数据的两种表示上评估每个模型。 *原始表示 (Raw)*。每笔信贷和借记事件都是一个单独的交易节点;最大的客户拥有多达 88,717 个交易节点(附录 D (https://arxiv.org/html/2609.00460#A4))。 *简单聚合表示 (Agg-Simple)*。交易被折叠为按支出类别的月度信贷和借记总和(表 `txn_monthly_cat`),支付被折叠为月度总额(表 `pay_monthly`)。最大邻域大小变为 `12 × C` 行,其中 `C` 是不同类别的数量。 两种表示编码相同的聚合信息;唯一的区别是基数。对两种表示应用相同的超参数网格,没有针对特定模型的调优。 ## 4 实验 我们使用超参数网格搜索(涉及学习率和架构深度)在两种表示上评估所有四个模型,搜索空间与每个模型原始论文中使用的相同。所有实验在单块 NVIDIA H200 GPU 上运行。对于 RT,搜索 `num_blocks ∈ {6, 12}` 和 `lr ∈ {3×10⁻⁵, 10⁻⁴, 3×10⁻⁴}`;对于 Griffin,搜索 `num_mp ∈ {2, 4, 6}` 和 `lr ∈ {10⁻⁴, 3×10⁻⁴, 10⁻³}`;对于 RelGT,搜索 `num_layers ∈ {4, 8}` 和 `lr ∈ {10⁻⁴, 3×10⁻⁴, 8×10⁻⁴}`。RT 运行时 `seq_len=1024`。主要评估指标是 R²;MAE 和 RMSE 作为次要指标报告。完整的网格搜索表在附录 B (https://arxiv.org/html/2609.00460#A2) 中。 结果如表 1 (https://arxiv.org/html/2609.00460#S4.T1) 所示。在原始表示下,RT、Griffin 和 RelGT 的得分 R² ≤ 0.18,其中 RelGT 由于内存限制完全无法构建图。GraphSAGE 达到 R² = 0.69。切换到 agg-simple 表示,RT 从 0.18 提升至 0.65(+0.47),Griffin 从 0.11 提升至 0.38(+0.27),证实了邻域预算假说。GraphSAGE 仅适度提升(0.69 → 0.75),与其在原始数据上已聚合大量邻居样本相符。包含 MAE 和 RMSE 的完整指标在附录 A (https://arxiv.org/html/2609.00460#A1) 中。 表 1:测试集 R²(越高越好),用于收入预测。每种模型的最佳结果来自超参数网格搜索。OOM:图构建超出内存。 表 2 (https://arxiv.org/html/2609.00460#S4.T2) 将失败具体化,按截止日期后信贷活动与其训练历史发生偏离的 N=474 名客户对 GraphSAGE 性能进行分层,这就是为什么所有分箱 R² 值都低于整体 0.69 到 0.75 的范围。对于低频客户(分箱 1–2,≤16 笔额外交易),原始表示略好,因为精细的事件模式携带了聚合所丢弃的信号。对于高频客户(分箱 3–4,≥16 笔额外交易),agg-simple 在两个分箱中都以 +0.44 R² 胜出。这种交叉点证实了失败局限于其邻域超出模型采样预算的客户。扩展的分箱指标在附录 C (https://arxiv.org/html/2609.00460#A3) 中。 表 2:GraphSAGE 测试集 R²,按截止日期后信贷交易计数分层(10,000 名测试客户中有 N=474 名行为在截止日期后发生变化;整体 Raw=0.692, Agg-Simple=0.752)。分箱值低于整体值,因为分箱隔离了最困难的情况。 *agg-simple* 表示是任何分析师都会作为常规数据准备执行的 SQL 聚合。从它恢复 0.2–0.5 的 R²,对于一个被宣传为基础模型的东西来说,是一个脆弱的结果。基础模型应该学习聚合什么,而不是依赖从业者先去做。 ## 5 结论 我们引入了 Animus,一个旨在暴露关系型深度学习模型邻域预算限制的合成金融基准测试。在原始表示下,三个近期提出的模型达到 R² ≤ 0.18,而一个常规的时序聚合步骤即可恢复高达 R² = 0.65。我们的分箱
相似文章
更大的上下文窗口并未解决企业记忆问题——原因如下
本文批评了LLM中不断扩大上下文窗口的趋势,认为由于检索退化、数据量和缺乏结构,这并不能解决企业知识问题。文章主张在检索之前建立知识建模层,以映射关系和意图。
上下文至关重要,但上下文腐烂才是AI智能体的真正上限,更大的上下文窗口只会让情况更糟而非更好
文章认为,上下文腐烂(即随着上下文填充导致推理质量下降)是AI智能体的真正上限,而非上下文窗口大小。它提倡采用架构方法分解任务并使用独立验证来超越限制。
Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension
This paper shows that four seemingly minor architectural choices—normalization, GQA, pretraining context length, and sliding window attention—have a compoundingly negative effect on long context extensibility, dropping performance by up to 47% when combined. The authors release OlmPool, a set of 26 comparable 7B models, after 170,000 GPU hours of controlled ablations.
我认为长上下文代理的失败方式非常无聊
一篇观点文章,认为长上下文窗口并不等同于记忆,代理失败通常很普通,比如忘记约束或重新读取文件,强调可靠性取决于上下文架构决策。
运行上下文的recirculation修复技术
论文介绍了'recirculation',这是一种针对基础模型的推理时架构增强技术,通过改进状态跟踪,显著降低了困惑度并提高了准确性,在生成过程中无额外延迟。