Trivium:将时间遗憾作为因果记忆控制器的一等目标
摘要
本文提出了“Trivium”框架,该框架将长时域时间遗憾和认知遗憾作为一等目标,与结果遗憾一同用于智能体LLM系统中的因果记忆控制器。作者证明,在没有干预通道的情况下,仅基于结果的学习无法区分因果结构与虚假结构,而他们的方法在CausalBench-Seq实验中实现了O(log E)的时间遗憾,而基线方法则为线性增长。
arXiv:2606.04421v1 Announce Type: new
摘要:许多当前的智能体系统和LLM管道通过优化结果奖励来纠正错误。这仅解决了失败的“什么”:当结果与预测不一致时,不匹配的“为什么”和“何时”并未被系统性地记录、审查或纠正,因此同一错误可能反复出现。我们认为这是一个结构性问题,而不仅仅是模型容量问题。我们提出将长时域时间遗憾作为一等目标,与结果遗憾和对当前因果模型的认知遗憾并列。时间遗憾捕捉失败持续的时间:一个校准错误的因果模型在纠正前被容忍了多久。认知遗憾捕捉失败持续的原因:当前因果模型中的残余不确定性或错误。三者共同提供了一个可证伪的说明,阐明一个长寿命智能体可能在什么、为什么以及何时失败。将智能体建模为一系列E个情节,我们在显式因果探测、持久性和可检测性假设下证明了三个条件结果。第一,在观察等价混淆下,没有干预通道时,仅基于结果的学习无法区分因果结构与虚假结构,因此即使结果遗憾被降至零,时间校准误差仍可线性持续。第二,有了持久因果日志和有预算的探测,总探测复杂度在情节时域上呈对数级,导致O(log E)的时间遗憾。第三,在K个可检测变化点下,该率扩展为O(K log E)。我们实现了Trivium并预先注册了五个可证伪的预测。在CausalBench-Seq上,Trivium遵循预测的对数包络线,而仅基于结果的基线呈线性增长。一个初步的真实LLM流提供了外部有效性证据,包括一次完整的E=500运行和三次E=100的前沿模型试运行。这里的自我学习是指修订外部因果模型,而非重新训练LLM权重。
查看缓存全文
缓存时间: 2026/06/05 02:07
# Trivium:将时序遗憾作为因果记忆控制器的一类目标
来源:https://arxiv.org/html/2606.04421
###### 摘要
当前许多智能体系统和 LLM 流程通过优化结果奖励来纠正错误。这仅关注失败的*内容*:当结果偏离预测时,*原因*和*时机*从未被系统地记录、审查或纠正,因此同样的错误会在一个又一个 episode 中重复出现。Yann LeCun 等人指出,当前的 LLM 无法真正从错误中学习;我们认为这是一个结构性问题,而非模型容量问题。我们提出将*长期时序遗憾*作为与结果遗憾并列的一类目标,同时搭配对工作因果模型的*认知遗憾*。时序遗憾捕捉*时机*:容忍一个未校准的因果模型持续多久才进行纠正。认知遗憾捕捉*原因*:对工作因果模型的残余不确定性。这三类遗憾共同提供了关于长期存在的智能体为何、如何以及何时失败的可证伪说明。将智能体建模为一系列 EEepisode 的流,我们在明确的因果探测、持久性和可检测性假设下证明了三个条件性结果。首先,在观测等价混淆条件下,仅基于结果的学习无法在没有干预通道的情况下区分因果结构与虚假结构,因此即使训练时的结果遗憾被降至零,时序失校仍可能线性持续。其次,借助持久因果日志和预算有限的探测,总探测复杂度与 episode 时间窗为对数关系,产生 O(logE)\mathcal{O}(\log E) 时序遗憾。第三,在 KK 可检测变更点下,该速率扩展为 O(KlogE)\mathcal{O}(K\log E)。我们实例化*Trivium*并预注册了五个可证伪预测。在受控的 CausalBench‑Seq 实验中,Trivium 遵循预测的对数包络线,而仅基于结果的基线呈线性增长。一次完整的 E=500E\!\!=\!\!500 运行和三次 E=100E\!\!=\!\!100 前沿模型试点提供了一个初步的外部有效性证据。这里的自我学习指的是对外部因果模型的修订,而非 LLM 权重层面的重新训练,这是一种任何调度策略(无论是否经过 RL 训练)均可包裹的基底层外部纠正通道。
## 1 引言
长期存在的智能体系统必须应对环境中那些最有影响力的原因往往不可见的情况:误读天气变化点的车队(例如匿名参考文献 App.R 中的城市拼车调度器)、错过需求变化的供应链、忽略累积风险因素的医疗系统、以及未能将早期预警信号与可行动干预联系起来的社会和教育系统。在每种情况下,对未观测混淆的累积遗憾并不会在奖励通道中自我宣告;一个仅基于结果的强化学习系统可以将训练时的结果遗憾降至零,而在部署阶段却长期基于错误的因果模型行动(Kallus 和 Zhou, 2018;Namkoong 等, 2020;Levine 等, 2020)。等到看不见的代价超过名义性能时,纠正窗口往往已经关闭。原因在于结构性问题:纠正信号——哪个隐藏原因被错误预测——对奖励通道不可见。Yann LeCun 长期以来一直认为当前 AI 系统无法像人类那样学习(LeCun, 2022):当计划失败时,人类会问*为什么*;而仅基于结果的学习者只看到*多少*奖励丢失了(Huang 等, 2024)。本文通过一个三遗憾目标以及在一系列共享持久因果日志的 EEepisode 上的条件识别结果,形式化了这一批评。一个观测等价分离表明,仅凭结果观测无法在没有干预通道的情况下区分因果上不同的世界,因此时序失校会线性持续。在有预算的因果探测和持久日志的情况下,总探测复杂度与 EE 成对数关系,从而在所述核算约定下产生对数延迟识别时的时序遗憾。
#### Trivium 的三幕结构。
我们提出*Trivium*,一种三遗憾驱动的更新机制,在三个层面识别、量化和追踪错误。*结果遗憾*捕捉*内容*:传统的强化学习信号,即答案的准确性。*认知遗憾*捕捉*原因*:对工作因果模型的残余不确定性。*时序遗憾*捕捉*时机*:容忍一个未校准的因果模型持续多久才进行纠正。在多个 episode 和长期时间窗上,Trivium 在持久日志中累积这三个信号并预先采取行动:从过去的错误中学习,在遗憾级联演变为部署失败之前纠正*原因*(其工作因果模型),从而改进*内容*。具体来说,忽略天气变化点的车队、忽略供应侧冲击的供应链控制器、或忽略累积风险因素的分诊系统,都承担着相同的结构性代价:未观测的混淆器在时间窗上累积,直到纠正性证据被记录,而它们累积的时间窗正是我们的定理所界定的*时机*(附录 Q.1 用紧凑的直升机运输示例展示了这一机制)。
#### 为何重要。
将*时序遗憾*作为与结果遗憾并列的一类目标,子线性时序遗憾重塑了任何存在重复结构化行动、持久因果记忆和干预通道的领域中的长期智能体系统:使用工具的 LLM 代理(Jin 等, 2023;Kıcıman 等, 2024)、多智能体软件工程循环、医院分诊系统和供应链控制器等。这类系统不仅学习*多少*奖励丢失了,还学习失败*为什么*发生,并在累积遗憾级联演变为部署失败之前*预先*采取行动。
#### 贡献。
1. 1. 三遗憾泛函与仅结果分离。一个结合结果、认知和时序诊断目标的三遗憾泛函(定义 3.1),搭配一个观测等价分离:仅基于结果的观测无法区分具有相同观测分布但因果结构不同的模型,从而在没有干预通道的情况下允许时序失校线性持续(附录 N)。
2. 2. 因果探测复杂度与诱导的时序遗憾速率。在承诺纪律下,episode 内探测复杂度为 O(m0σ2κmin−2logT)\mathcal{O}(m_{0}\sigma^{2}\kappa_{\min}^{-2}\log T)(定理 3.3);借助持久日志,总探测复杂度与 EE 成对数关系,产生 O(logE)\mathcal{O}(\log E) 延迟识别时的时序遗憾(在正每探测信息条件下,定理 3.4);匹配的总探测下界在结构扇出之前成立(定理 3.5);在有 KK 可检测变更点的情况下,该速率分段扩展到 O(KlogE)\mathcal{O}(K\log E) 加上检测延迟(定理 3.8)。
3. 3. 算法实例化。Trivium 通过持久因果事务日志、预算因果探测、承诺检查、CUSUM 触发的重置和 LRCP 局部修复来实例化这些假设。LRCP 在局部收缩证书下分析(命题 3.11),CausalBench‑Seq 的收缩迹线直接证实了这一点(每种子 κ^=0.866\hat{\kappa}=0.866)。调度耦合(定理 3.9,通过消融 A6 的回归证实,R2=0.986R^{2}=0.986,附录 V)和物理接地(定理 3.10,以及推论 I.1 中的端到端组合陈述)结果表明,在明确的预言机调度、Lipschitz 和事务基底假设下,识别速率如何转化为行动质量和下游部署性能。
4. 4. 预注册的受控验证,以及一个初步的真实 LLM 流。五个预注册预测:RQ1–RQ4 关于 CausalBench‑Seq(一个混淆的线性高斯流),全部得到证实;RQ5 关于在匿名 (2026a) 的 cap‑gsm8k 对抗性提示协议下的真实 LLM 流,叠加在 gsm8k(Cobbe 等, 2021)上,在五个前沿模型家族中的四个上得到证实(Llama‑3.3‑70b、GPT‑4o、Claude‑Sonnet‑4.5、GPT‑3.5‑Turbo;Gemini‑2.5‑Flash 因免费层配额延迟),其中在 E=500E\!\!=\!\!500 时 Trivium 在 Llama‑3.3‑70b 上实现了 103×103\times 峰值减少,并在已完成运行上实现了约 24×\approx\!24\times 几何均值减少,包括一次完整的 E=500E\!\!=\!\!500 运行和三次 E=100E\!\!=\!\!100 试点(附录 W)。四个贡献中的每一个都由一个定理(或定义/命题/引理/推论)和一个预注册实验或消融支持;完整映射见表 5(附录 A)。
## 2 相关工作
Trivium 连接了四个文献领域,每个都在附录 B 的平行小节中展开。第一,离线且混淆的 RL 表明,在未观测混淆下的仅结果学习是有限的(“缺乏学习”批评,LeCun, 2022);我们的附录 N 分离是互补的,使用观测等价的 SCM,其被动结果流匹配但干预分布不同。第二,自我改进的 LLM 方法、LLM 因果推理基准以及最近的以对象为中心的世界模型(如 Causal‑JEPA, Nam 等, 2026)显示了模型内部批评和潜在因果归纳偏差的价值;Trivium 是互补的,将纠正信号放在基底外部因果日志中,并询问累积证据何时应修订未来策略。第三,因果 Bandit 研究主要是在单 episode 设置中的干预预算识别;Trivium 将其扩展到具有持久因果证据和总探测下界的 episode 流(Audibert–Bübeck 风格, Audibert 等, 2010)。第四,经典识别(do‑演算, Pearl, 2009)、CUSUM 变点检测、事务记忆和信念修正提供了 CTL 和漂移恢复分析所使用的原语。附录 B.2 还讨论了关于该问题正交的 episode 内因果批评侧(*为什么*在一个 episode 内;Trivium 解决的是跨 episode 流的*何时*)的同期化名工作。
## 3 理论框架
图 1 描绘了端到端架构;符号在首次引入时定义,并收集于表 6(附录 O.1)。我们将长期调度形式化为一个因果结构的递推决策过程,定义了一个关于结果、认知和时序诊断目标的三遗憾泛函,并陈述了第 4 节实验测试的收敛性和漂移恢复保证。证明在附录 C–N 中;与相邻文献(因果 Bandit、变点检测、干预下识别、事务记忆)的定位见附录 O。
区域 1 · 情节内循环
智能体规划器(多 LLM,使用 G⋆G^{\star})
环境(规划基准)
结果 (Xt,Yt)(X_{t},Y_{t})
识别器(*为什么?*归因)
结果遗憾(“多少”损失)
认知遗憾 ρ\rho(模型不确定性)
时序遗憾(失校时间)
区域 2 · 因果事务日志(事务基底,先验)
Episode 1 (上下文,干预,输出,为什么)
Episode 2 (跨代理)
Episode 3 (不同任务)
... Episode EE(增长的日志)
原子 · 快照隔离 · 持久
区域 3 · 跨情节学习(遗憾→学习→重规划)
CTL 挖掘器(聚合错误)
定理 ce‑上/下界
混淆器发现(GinfG^{\mathrm{inf}} 上的后验,缺失原因)
承诺检查(Ginf→G⋆G^{\mathrm{inf}}\to G^{\star},二层图)
更新后的 G⋆G^{\star} 工作模型用于下一 episode
重规划:下一 episode 初始化(更新后的 G⋆→G^{\star}\to 规划器)
区域 4 · 耦合
CUSUM 变点(定理漂移)
调度耦合器(ρ\rho‑预算门,定理调度)
接地(W1W_{1} 界,执行器 ε,η\varepsilon,\eta,定理接地)
结果流(ρ\rho‑预算,执行器 ε,η\varepsilon,\eta,信号)
重启窗口(ρ\rho‑门控行动选择,W1W_{1} 界)
图 1:时序遗憾最小化的计算结构。实线边框的方框是 Trivium 的贡献;虚线边框的方框是负载支撑的先验工作基础(规划环境和 CTL 实现)。区域 2(阴影)是一个持久事务性*因果事务日志*。信息流为*遗憾→日志→学习→重规划*:区域 1 发出三个遗憾信号;区域 2 每 episode 记录一个跨代理条目;区域 3 为下一 episode 更新二层图 Ginf→G⋆G^{\mathrm{inf}}\to G^{\star};区域 4 通过 CUSUM、ρ\rho‑预算调度和 W1W_{1}‑有界接地可选地耦合到结果遗憾。
### 3.1 设置与三遗憾泛函
一个*episode* e∈{1,…,E}e\in\{1,\dots,E\} 是一个时间窗为 TT 的调度窗口;在时间 tt,一个由 MM 个体组成的种群观察上下文 XtX_{t},选择行动 AtA_{t},并实现结果 YtY_{t}。区分两个图:*影响图* GinfG^{\mathrm{inf}}(候选混淆器,认知不确定性所在的对象)和*精炼 DAG* G⋆⊆GinfG^{\star}\subseteq G^{\mathrm{inf}}(带有已识别的边权重,即调度策略一旦识别后所依据的对象)。所有 episode 都写入一个持久*因果事务日志*(CTL),这是使得跨 episode 累积成为可能的认知记忆。一个*干预* do(Z=z)\mathrm{do}(Z=z) 是昂贵的,每 episode 预算上限为 BB;调度器将 BB 分配到 GinfG^{\mathrm{inf}} 中的节点。
#### 实例参数(全文使用)。
m0:=|{Z∈Ginf:|κZ|≥κmin}|m_{0}:=|\{Z\in G^{\mathrm{inf}}:|\kappa_{Z}|\geq\kappa_{\min}\}| 是*信息混淆器基数*:效应大小超过承诺阈值 κmin>0\kappa_{\min}>0 的候选节点数量。σ2\sigma^{2} 是结果上的次高斯噪声方差;Δmax\Delta_{\max} 是每步结果遗憾差距;doutmaxd_{\mathrm{out}}^{\max} 是 GinfG^{\mathrm{inf}} 中的最大出度。相似文章
大型语言模型中时间偏好概念及其功能
本文在蒸馏大型语言模型中因果定位了用于时间偏好的子图,发现该模型对未来折现的幅度比人类更平缓,并且引导向量可以改变时间偏好,凸显了显式控制机制的必要性。
用于具有不可观测记忆状态的欧拉-拉格朗日系统自适应控制的时序注意力
本文提出了一种利用时序自注意力进行元控制的架构,旨在对具有不可观测记忆状态的欧拉-拉格朗日系统进行自适应控制。在2自由度机械臂上的实验表明,该方法在追踪性能上优于基线方法,同时揭示了在长记忆机制下的失效模式。
检索记忆中的时间有效性:消除AI代理在知识演化中的过时事实错误
本文介绍了MemStrata,一种维护时间有效性的检索记忆系统,用于消除AI代理在知识演化中的过时事实错误。它在演化基准测试上优于RAG,同时保持静态召回率,使用确定性替代层而无需LLM调用。
学会记住什么:面向长时域语言代理的基于约束优化的可观测性安全记忆保留
本文将为长时域语言代理的记忆保留公式化为一个约束随机优化问题,提出了OSL-MR框架,该框架通过混合评分启发式强制实施可观测性安全学习。实验表明,在严格记忆预算下,该方法始终优于现有的启发式基线。
@omarsar0: // LLM 智能体中的记忆诅咒 //(建议收藏)过长的历史记录显然会导致智能体性能下降,因为它们变得越来越…
本研究论文揭示了 LLM 智能体中的“记忆诅咒”现象,证明扩大的上下文窗口会通过削弱前瞻性意图,系统性地破坏多智能体社会困境中的合作行为。作者表明,通过定向微调、合成记忆净化以及减少显式思维链(Chain-of-Thought)推理,可有效缓解此类行为衰退。