流式系统中事件触发大语言模型调用的不确定性感知序贯决策规则

arXiv cs.LG 论文

摘要

本文将在流式推理系统中何时调用大语言模型的问题形式化为基于风险的序贯停止问题。文中证明了理论保证,并在涡扇退化数据上对框架进行了实证验证。

arXiv:2607.13048v1 公告类型:新 摘要:流式推理管道越来越多地将轻量级快速模型与大语言模型(LLMs)结合使用,后者以高昂成本提供丰富的语义理解。何时调用大语言模型这一核心问题尚未得到充分的正式处理。我们将其形式化为基于风险的序贯停止问题,当观测历史的风险泛函超过阈值时,触发策略启动。在此框架内,我们证明了六个结果:排除触发抖振的最小事件间时间界;通过平滑粘贴得到的阈值策略最优性;估计参数下的近似SPRT保证;平稳流的O(√(T log T))遗憾,在C_T个变点下扩展为O(√((C_T+1) T log T));自适应阈值的在线梯度下降的O(1/√T)收敛性;以及校准到漏报率的传递不等式。几个经典的触发族,包括事件触发、最优停止、SPRT、CUSUM和贝叶斯触发,都可以表示为该框架的特例。在涡扇退化数据(CMAPSS)上,结合真实的大语言模型调用,我们实证验证了理论假设,消融了风险函数设计,与包括RouteLLM风格路由器和上下文强盗在内的六个基线进行了比较,并分析了成本敏感性和大语言模型故障模式。结果确认了亚线性遗憾,所有原则性触发的α<1;诊断质量高,在我们的评分标准下,1600次大语言模型诊断中有92.9%达到了基础分数≥0.75;并且异常分数驱动的风险函数在Pareto AUC上优于替代方案约一个数量级。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:21

# 面向事件触发的大语言模型(LLM)在流式系统中调用的不确定性感知序贯决策规则

来源:https://arxiv.org/html/2607.13048

11institutetext:维特比工学院,南加州大学,洛杉矶,CA,美国  
11email:zwang000@usc\.edu  

Zhaohui Wang

###### 摘要

流式推理管线日益将轻量级“快速模型”与能够提供丰富语义理解但成本高昂的大型语言模型(LLM)相结合。关于*何时*调用 LLM 这一核心问题,目前尚未得到充分的正式处理。我们将此问题建模为一个基于风险的序贯停止问题,其中当风险泛函 \(R(H_t)\) 超过阈值 \(\theta\) 时,触发策略 \(\pi\) 被激活。在此框架内,我们证明了六项结果:排除触发抖动的最小事件间隔时间上界;通过平滑粘贴条件得到的阈值策略最优性;在估计参数下的近似 SPRT 保证;针对平稳流的 \(O(\sqrt{T \log T})\) 遗憾(在存在 \(C_T\) 个变化点的情况下扩展至 \(O(\sqrt{(C_T + 1)\, T \log T})\));自适应阈值的在线梯度下降以 \(O(1/\sqrt{T})\) 速率收敛;以及校准到遗漏率的传递不等式。包括事件触发、最优停止、SPRT、CUSUM 和贝叶斯触发在内的几种经典触发族,均可表示为该框架的特例。在涡轮风扇退化数据(CMAPSS)上结合真实 LLM 调用,我们实证验证了理论假设,消融了风险函数设计,与包括 RouteLLM 风格路由器和上下文强盗在内的六种基线进行了比较,并分析了成本敏感性和 LLM 失效模式。结果证实了亚线性遗憾(所有原则性触发器的 \(\alpha < 1\))、高诊断质量(我们评分准则下 1,600 个 LLM 诊断中有 92.9% 的扎根分数达到 \(\geq 0.75\)),并且异常分数驱动的风险函数在帕累托 AUC 上比替代方案大约优一个数量级。

## 1 引言

工业传感器网络、自动驾驶汽车和网络监控系统面临一个共同的结构性矛盾。一方面,它们需要连续实时推理:一个轻量级模型必须以亚秒级延迟处理每个观测值。另一方面,当系统遇到模糊或安全关键情况时,一个更丰富的模型(越来越多地是 LLM)能够提供紧凑神经网络无法提供的语义上下文。困难在于协调这些需求:LLM 比边缘模型慢两到四个数量级且成本更高,因此每一步都调用它们是不可行的,但在关键时刻不调用则可能是灾难性的。本文为以下问题提供了一个原则性的答案:*给定一个具有校准不确定性的神经网络模型输出流,应在何种条件下咨询昂贵的 LLM 预言机?*

我们通过序贯决策理论的形式化方法来解决这个问题,将其与最优停止\[14 (https://arxiv.org/html/2607.13048#bib.bib14)\]、序贯假设检验\[21 (https://arxiv.org/html/2607.13048#bib.bib21)\]和事件触发控制\[6 (https://arxiv.org/html/2607.13048#bib.bib6)\]的经典结果联系起来。具体来说,所有这些(以及实践中使用的其他几种触发机制)都可以理解为对风险泛函的阈值策略:当累积风险超过边界时,系统调用 LLM。

将经典序贯决策理论应用于具有学习不确定性的流式神经预测,引入了现有理论未解决的两个挑战。神经不确定性估计经常被错误校准\[4 (https://arxiv.org/html/2607.13048#bib.bib4)\],并且数据生成过程可能是非平稳的,需要随时间自适应的决策边界。我们的理论框架解决了这两个问题:我们证明了一个校准到遗漏率的传递不等式,量化了错误校准的成本;以及一个自适应阈值的在线梯度下降收敛结果。我们的贡献有四个方面。首先,我们引入了一个统一的基于风险的框架,其中事件触发、最优停止、SPRT、CUSUM、自适应和贝叶斯触发器都是 \(\pi_\theta(H_t) = \mathbf{1}[R(H_t) \geq \theta]\) 的特例,并且我们在此框架内证明了六项理论结果(第 3 节 (https://arxiv.org/html/2607.13048#S3))。其次,我们在真实传感器数据上实证验证了这些结果所依据的假设(有界触发信号增量、下鞅风险、单调性、平稳性)(第 5 节 (https://arxiv.org/html/2607.13048#S5))。第三,我们对风险函数结构进行了系统消融,并与包括学习型路由器和上下文强盗在内的六种基线进行了比较,确立了该框架的实际操作特性(第 6 节 (https://arxiv.org/html/2607.13048#S6))。第四,我们分析了 LLM 诊断质量、成本敏感性和失效模式,以评估部署准备情况(第 7 节 (https://arxiv.org/html/2607.13048#S7))。

##### 范围. 本文研究何时调用 LLM 的序贯决策问题,将其表述为风险泛函阈值策略、遗憾、校准和在线自适应。它不建模硬实时可调度性、最坏情况执行时间(WCET)、队列响应时间分析或混合关键性调度;这些系统级时序问题不在本文的讨论范围内。

引用图例
图 1: 系统概述。快速模型处理每个流式观测值,产生预测和校准不确定性。当 \(R(H_t) \geq \theta_t\) 时触发策略激活,在少量时间步上调用 LLM,调用率由触发阈值控制。自适应反馈循环通过 OGD 或 LinUCB 更新 \(\theta_t\)。

## 2 问题形式化

考虑一个流 \(\{x_t\}_{t=1}^T\),其中 \(x_t \in \mathcal{X}\)。快速模型 \(f_\psi : \mathcal{X} \to \mathcal{Y} \times \mathbb{R}_+\) 以延迟 \(\tau_{\text{fast}} \ll 1\) 秒产生预测 \(\hat{y}_t\) 和不确定性估计 \(u_t\)。慢速预言机(LLM)\(g_\phi\) 以成本 \(c_{\text{LLM}} \gg 0\) 产生语义诊断。触发策略 \(\pi: \mathcal{H}_t \to \{0,1\}\) 在每一步决定是否调用预言机,其中 \(\mathcal{H}_t = (x_1, \hat{y}_1, u_1, \ldots, x_t, \hat{y}_t, u_t)\) 是直到时间 \(t\) 的观测历史。设计目标平衡调用成本与遗漏关键事件的概率:

\[
\min_{\pi} \; \mathbb{E}\Bigl[ \sum_{t=1}^T \pi(\mathcal{H}_t) \cdot c_{\text{LLM}} \Bigr] \quad \text{s.t.} \quad \mathbb{P}[\text{miss critical}] \leq \epsilon.
\tag{1}
\]

我们定义一个风险泛函 \(R: \mathcal{H}_t \to \mathbb{R}_+\),聚合异常分数 \(a_t\)(衡量与学习到的正常行为的偏离程度,例如归一化预测残差)、预测不确定性 \(u_t\) 和时间上下文。阈值策略的形式为:

\[
\pi_\theta(\mathcal{H}_t) = \mathbf{1}[R(\mathcal{H}_t) \geq \theta].
\tag{2}
\]

\(R\) 的构造并非唯一;在第 6.2 节 (https://arxiv.org/html/2607.13048#S6.SS2) 中,我们系统地比较了八种候选形式,并表明其选择对调用率-遗漏率权衡有重大影响。

## 3 理论框架

我们现在陈述构成我们框架正式基础的六项理论结果。对于每一项,我们都明确说明了所需的假设,并将证明推迟到补充材料的附录 A。

### 3.1 事件触发调用与抖动排除

###### 定义 1(事件触发规则) 令 \(h_t\) 为快速模型的隐藏状态,\(\bar{h}\) 为名义参考。事件触发条件为 \(\tau_t^{\mathrm{ET}} = \mathbf{1}\bigl[ \|h_t - \bar{h}\|_Q > \delta + \sigma(t - t_{\mathrm{last}}) \bigr]\),其中 \(\|\cdot\|_Q\) 是加权范数,\(Q \succ 0\),\(\delta > 0\) 是阈值,\(\sigma \geq 0\) 控制时间依赖的松弛。

###### 定理 3.1(最小事件间隔时间) 令 \(s_t := \|h_t - \bar{h}\|_Q\) 为驱动触发器的标量信号(更一般地,累积风险 \(R_t\))。假设对于所有 \(t\),\(s_t\) 具有有界增量 \(|s_{t+1} - s_t| \leq L_s\)(一个充分条件是 Lipschitz 隐藏状态动力学 \(\|h_{t+1} - h_t\| \leq L\),这给出 \(L_s \leq \|Q\|^{1/2} L\)),且触发阈值满足 \(\theta > s_0 + L_s\)。那么,后续事件触发之间的时间间隔 \(\Delta_t = t_{\text{next}} - t_{\text{current}}\) 满足下界 \(\Delta_t > (\theta - s_{t_{\text{current}}} - L_s) / L_s\)。特别地,如果信号以速率 \(\mu > 0\) 漂移,该下界在假设下至少为 \((\theta - s_0) / (\mu + L_s)\)。该下界排斥了抖动(无法阻止物理系统级的抖动,但确保了在与噪声水平相比足够大的阈值下,触发不能以任意快的速率重新激活)。

### 3.2 阈值策略的最优性

###### 定义 2(风险泛函) 令 \((\Omega, \mathcal{F}, \mathbb{P})\) 为概率空间,\(\{\mathcal{F}_t\}\) 为滤波。风险泛函 \(R: \mathcal{H}_t \to \mathbb{R}_+\) 满足:对于所有 \(t\),\(R_t\) 关于 \(\mathcal{F}_t\) 可测,且过程 \((R_t, \mathcal{F}_t)\) 是一个下鞅,即 \(\mathbb{E}[R_{t+1} \mid \mathcal{F}_t] \geq R_t\)。

###### 定理 3.2(阈值策略的最优性) 考虑问题 (1),其中风险 \(R_t\) 是一个下鞅。令 \(V_t(r) = \inf_{\pi} \mathbb{E}[ \sum_{j=t}^T \pi_j c_{\text{LLM}} + c_{\text{miss}} \mathbf{1}\{\text{miss critical}\} \mid R_t = r]\) 为值函数。那么,最优停止规则是阈值策略:存在一个 \(\theta^*(t) > 0\) 使得最优策略为 \(\pi_t^*(R_t) = \mathbf{1}[R_t \geq \theta^*(t)]\)。此外,\(\theta^*(t)\) 满足光滑粘贴条件:\(V_t(r)\) 在 \(r = \theta^*(t)\) 处连续可微。

该结果将下鞅性质与阈值最优性联系起来,并将最优停止理论所要求的风险下鞅条件具体化。

### 3.3 近似 SPRT 保证

###### 定理 3.3(近似 SPRT) 令风险泛函取对数似然比形式 \(R_t = \log( \mathbb{P}[H_t \mid \text{anomaly}] / \mathbb{P}[H_t \mid \text{normal}] )\)。设 \(e_t = \hat{R}_t - R_t\) 为由于参数不确定性导致的近似误差,并假设误差有界:\(|e_t| \leq \delta\),\(\mathbb{P}\)-几乎必然。那么,在策略 \(\pi_\theta(H_t) = \mathbf{1}[R_t \geq \theta]\) 下的第一类错误概率 \(\alpha = \mathbb{P}[\text{fire} \mid \text{normal}]\) 和第二类错误概率 \(\beta = \mathbb{P}[\text{no fire} \mid \text{anomaly}]\) 满足:
\[
\alpha \leq \frac{1}{e^{(\theta - \delta)}}, \quad \beta \leq 1 - e^{-(\theta + \delta)}.
\]
此外,有限样本条件下,真实阈值 \(\theta\) 与所需误差率之间的偏差最多为 \(O(\delta)\)。

该结果将 SPRT 近似保证推广到存在参数误差的情况。

### 3.4 平稳流的遗憾上界

###### 定理 3.4(亚线性遗憾) 设 \(R_t\) 为平稳且 \(\phi\)-混合的,混合系数满足 \(\sum_{t \geq 1} \phi(t) < \infty\)。令 \(\theta_T\) 为基于大小为 \(T\) 的回顾窗口选择的固定阈值,且 \(C_T\) 为流中的变化点数量。那么,对于任何 \(T\),后悔 \(Reg_T = c_{\text{LLM}} \sum_{t=1}^T \pi_t - \min_\theta \mathbb{E}[c_{\text{LLM}} \sum_{t=1}^T \pi_t^\theta]\) 满足:
- 平稳情况(\(C_T = 0\)):\(Reg_T = O(\sqrt{T \log T})\),
- 非平稳情况(一般 \(C_T\)):\(Reg_T = O(\sqrt{(C_T + 1) \, T \log T})\)。

该上界通过 Auer 等人 (2002) 的指数加权平均(AEW)算法或考虑变化点数量的滑动窗口 OGD 达到。

### 3.5 自适应阈值的在线梯度下降收敛性

###### 定理 3.5(OGD 收敛性) 设损失函数 \(\ell_t(\theta) = c_{\text{LLM}} \mathbf{1}[R_t \geq \theta] + \lambda \mathbf{1}[R_t \geq \theta \text{ and not critical}]\) 对 \(\theta\) 是凸的,且梯度有界,\(\|\nabla \ell_t(\theta)\| \leq G\)。令步长为 \(\eta_t = \eta_0 / \sqrt{t}\)。那么,在线梯度下降产生的序列 \(\{\theta_t\}\) 满足:
\[
\frac{1}{T} \sum_{t=1}^T \ell_t(\theta_t) - \frac{1}{T} \sum_{t=1}^T \ell_t(\theta^*) \leq \frac{G \theta_0}{\sqrt{T}},
\]
其中 \(\theta^*\) 是后验最优固定阈值。因此,平均遗憾以 \(O(1/\sqrt{T})\) 速率收敛。

该定理提供了使用 OGD 自适应调整阈值的收敛保证。

### 3.6 校准到遗漏率的传递不等式

###### 定理 3.6(校准到遗漏率传递) 设 \(\hat{p}_t = \mathbb{P}[ \text{critical} \mid u_t ]\) 为关键事件的后验概率,其中 \(u_t\) 为预测不确定性。假设不确定性校准误差满足 \(\sup_u | \mathbb{P}[ \text{critical} \mid u_t \leq u ] - u | \leq \epsilon\)。令 \(\theta_u\) 为不确定性阈值,使得当 \(u_t \leq \theta_u\) 时该步被视为“正常”而不调用 LLM。那么,遗漏关键事件的联合概率满足:
\[
\mathbb{P}[\text{critical}, \, u_t \leq \theta_u] \leq \theta_u + \epsilon.
\]
等价地,条件遗漏率满足 \(\mathbb{P}[u_t \leq \theta_u \mid \text{critical}] \leq \min\{1, (\theta_u + \epsilon)/p\}\),其中 \(p = \mathbb{P}[\text{critical}]\)。

该结果显式地表示了错误校准的成本:在统一校准误差 \(\epsilon\) 下,遗漏关键事件的联合概率最多为 \(\theta_u + \epsilon\)。该界在不确定性阈值上是单调的(提高 \(\theta_u\) 会减少调用次数并允许更多遗漏),并且随着 \(\epsilon\) 的增加而优雅地退化。它仅认证框架的不确定性阈值组件,而非任意的复合风险泛函;当异常分数主导排序信号时(第 6.2 节 (https://arxiv.org/html/2607.13048#S6.SS2)),校准不确定性作为补充的安全信号,而不是复合触发器的独立保证。该界需要统一的(在 \(u\) 上的最坏情况)校准误差;表 3 (https://arxiv.org/html/2607.13048#S6.T3)(a) 中针对四种不确定性方法报告的平均校准误差(ECE)是校准质量的实验证据,而非直接代入该界。

### 3.7 统一视角

这里考虑的所有触发族都是 \(\pi_\theta(H_t) = \mathbf{1}[R(H_t) \geq \theta]\) 的实例,具有不同的风险泛函。事件触发控制使用 \(R = \|h_t - \bar{h}\|_Q\);最优停止使用折扣累积风险;SPRT 使用对数似然比;CUSUM 使用单侧累积和;贝叶斯触发器使用异常的后验概率。这种统一不仅仅是符号上的:它使得单一自适应机制(对 \(\theta\) 的 OGD 或 LinUCB)能够适用于所有触发类型。

### 3.8 从理论到评估的路线图

上述每个理论结果都位于一个三步链中:(i) 该结果依赖于关于底层流的一个或多个假设,(ii) 每个假设都在真实数据上直接检查,(iii) 然后,该结果的每个预测都与实验测量进行比较。表 1 (https://arxiv.org/html/2607.13048#S3.T1) 为读者索引了此链:每一行将一个理论结果与其在第 5 节 (https://arxiv.org/html/2607.13048#S5) 中的验证条目以及在第 6 (https://arxiv.org/html/2607.13048#S6)–7 节 (https://arxiv.org/html/2607.13048#S7) 中测试其预测的实验配对。关注特定定理的读者应遵循其所在行。

表 1: 定理 → 假设 → 验证 → 实验测试,针对第 3 节 (https://arxiv.org/html/2607.13048#S3) 中的每个结果。

## 4 系统架构

快速模型是一个具有双头的 GRU 网络:用于预测的 \(\hat{y}_t = \mathrm{FC}(h_t)\) 和用于方差的 \(\hat{\sigma}_t^2 = \mathrm{Softplus}(\mathrm{FC}'(h_t))\),通过最小化异方差损失 \(\mathcal{L} = \frac{1}{2} \log \hat{\sigma}^2 + \frac{(y - \hat{y})^2}{2 \hat{\sigma}^2}\) 进行训练。我们比较了四种不确定性估计方法:方差头、MC Dropout\[2 (https://arxiv.org/html/2607.13048#bib.bib2)\](\(N=20\) 次前向传播)、深度集成\[9 (https://arxiv.org/html/2607.13048#bib.bib9)\](\(K=5\) 个模型)和温度缩放\[4 (https://arxiv.org/html/2607.13048#bib.bib4)\]。自适应阈值通过 OGD\[22 (https://arxiv.org/html/2607.13048#bib.bib22)\](\(\theta_{t+1} = \mathrm{proj}[\theta_t - \eta_t g_t]\))或 LinUCB\[11 (https://arxiv.org/html/2607.13048#bib.bib11)\](\(\theta_t = c_t^\top \hat{w}_t + \alpha \sqrt{c_t^\top A_t^{-1} c_t}\))更新。算法 1 (https://arxiv.org/html/2607.13048#alg1) 总结了推理循环。

算法 1 不确定性感知事件触发 LLM 调用

1: 输入: 流 \(\{x_t\}\),快速模型 \(f_\psi\),触发器 \(\pi\),预言机 \(g_\phi\)
2: for \(t = 1, 2, \ldots\) do
3:   \((\hat{y}_t, u_t) \leftarrow f_\psi(x_t)\)
4:   \(R_t \leftarrow \textsc{UpdateRisk}(\hat{y}_t, u_t, \mathcal{H}_t)\)
5:   if \(R_t \geq \theta_t\) then
6:     \(d_t \leftarrow g_\phi(\mathcal{H}_{t-w:t})\)   ▷ 调用 LLM 预言机
7:     \(\theta_{t+1} \leftarrow \textsc{AdaptThreshold}(\theta_t, R_t, d_t)\)
8:   end if
9:   yield \(\hat{y}_t, u_t\)
10: end for

## 5 假设的实证验证

##### 数据集。 我们使用两个公开的传感器流基准,它们共同在逐渐退化和突发异常任务上测试触发框架。*NASA C-MAPSS*\[15 (https://arxiv.org/html/2607.13048#bib.bib15)\] 模拟了涡轮风扇发动机在不同运行条件和故障模式下的从运行到失效过程,包含四个子集 FD001–FD004(FD001 中有 100 个训练单元和 100 个测试单元;按周期采样的 21 个传感器通道,频率 1 Hz;真实剩余寿命)。它是流式预测的经典基准,与本文的风险失效框架非常契合。*CIC-IDS2017*\[17 (https://arxiv.org/html/2607.13048#bib.bib17)\] 是一个带标签的网络入侵基准,包含约 282 万个流记录,涵盖正常流量和 14 种攻击类型,我们从中抽取了一个分层的 225K 流子集(第 7.4 节 (https://arxiv.org/html/2607.13048#S7.SS4));我们将其用作跨领域完整性检查,以验证触发框架是否从连续退化域转移到二元异常流。CMAPSS 是第 5 节 (https://arxiv.org/html/2607.13048#S5)–6 节 (https://arxiv.org/html/2607.13048#S6) 的主要评估域;CIC-IDS2017 的结果出现在第 7.4 节 (https://arxiv.org/html/2607.13048#S7.SS4) 中。

第 3 节 (https://arxiv.org/html/2607.13048#S3) 中的理论结果依赖于关于数据生成过程的假设。在评估性能之前,我们直接在 CMAPSS FD001 上跨五个随机种子测试这些假设。下面的每个段落将一个假设与其测量配对,第 3 节 (https://arxiv.org/html/2607.13048#S3) 中相应的定理向前指向支持它的条目。

##### 有界触发信号增量。 定理 3.1 (https://arxiv.org/html/2607.13048#S3.Thmtheorem1) 要求触发

相似文章

ProactiveLLM: 学习主动交互的流式大语言模型

arXiv cs.CL

ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。