神经代理控制:一种基于深度学习、LLM驱动的代理AI框架,用于安全控制的管控
摘要
本文介绍了一种神经代理控制框架,该框架将一个基于LLM的规划器(Gemini 2.5 Flash-Lite)与一个预训练的时间序列基础模型(TimesFM)相结合,用于工业物联网中基于物理的自主防御。一种反事实物理注入机制确保仅执行安全、非幻觉的动作,在SWaT数据集上实现了零无效动作,并且比LSTM和TCN基线具有更好的入侵预防效果。
查看缓存全文
缓存时间: 2026/07/13 07:52
# 神经代理控制:一种基于深度学习的LLM驱动代理AI框架,用于安全控制器的自主防御
来源:https://arxiv.org/html/2607.09076
Bipin Chhetri¹, Deepika Giri², Sima Siami-Namini³, Akbar Siami Namin¹
¹ 德克萨斯理工大学计算机科学系
² 坎伯兰大学
³ 约翰霍普金斯大学高级学术项目科学系
{saroj.gopali, bipin.chhetri, akbar.namin1}@ttu.edu
[email protected]
[email protected]
###### 摘要
针对操作技术的网络攻击日益导致代价高昂的停机时间和物理损坏,暴露了工业物联网环境中传统基于规则监控的局限性。虽然大语言模型(LLMs)具有强大的语义推理能力,可辅助决策支持,但其幻觉特性在闭环控制中带来了不可接受的安全隐患。本文提出了一种神经代理控制框架,这是一种新颖的架构,它将基于LLM的规划器(例如Gemini 2.5 Flash-Lite)与预训练的时间序列基础模型(TimesFM)相结合,以实现基于物理原理的自主防御。本文引入了一种“反事实物理注入”机制,在执行动作之前,在基础模型的数值潜在空间中模拟LLM提出的干预措施的影响,同时允许系统拒绝幻觉性或不安全动作。在工业数据集(例如安全水处理SWaT)上,针对随机攻击场景进行的评估表明,该框架的性能优于LSTM和TCN基线模型。神经代理循环预防了五次越界事件(33.3%),低于阈值,而LSTM和TCN分别为26.7%和13.3%,并且执行的物理无效(幻觉)动作次数为零。这些结果证明了使用基础模型作为确定性“哨兵”来保护关键基础设施中代理AI的有效性。
## I. 引言
针对操作技术的网络攻击日益导致工业组织发生真实的过程中断和代价高昂的停机时间。Kaspersky ICS 2023 [13 (https://arxiv.org/html/2607.09076#bib.bib5)] 识别了多起制造商因勒索软件和针对性入侵被迫停止生产线的案例。同时,对非计划停机的分析显示,汽车行业制造商每损失一小时,损失超过200万美元,而快消品行业约为39,000美元 [22 (https://arxiv.org/html/2607.09076#bib.bib11)]。在网络物理系统(CPS)中,安全故障不再是抽象的IT事件,而是直接导致安全风险和重大经济损失的因素。在日益密集的工业物联网部署中,数十亿互联设备扩大了攻击面,使得逐设备的手动加固和监控在规模上根本不可行。
大型语言模型(LLMs)和时间序列基础模型最近已成为对高维流数据进行预测和推理任务的高效工具。LLMs和时间序列模型相结合,可以实现大规模预测,用于维护、决策支持和异常检测 [16 (https://arxiv.org/html/2607.09076#bib.bib2),14 (https://arxiv.org/html/2607.09076#bib.bib1)]。鉴于LLMs的兴起,基础模型作为保护网络物理系统的有用世界模型,为各种应用展现了令人兴奋的可能性。主动风险缓解基于在各种操作场景中预测未来轨迹。最近,TimesFM和其他时间序列基础模型被提出作为通用预测器,在大型和多样化的时间序列语料库上进行训练 [6 (https://arxiv.org/html/2607.09076#bib.bib3)]。
然而,大多数现有的用于物联网和时间序列预测的代理系统都在离线环境下运行,主要关注推荐或选择模型。用于优化代码的模型仅限于离线辅助,不参与安全关键过程的闭环控制 [3 (https://arxiv.org/html/2607.09076#bib.bib39)]。此外,近期有证据表明基础模型可能产生幻觉 [5 (https://arxiv.org/html/2607.09076#bib.bib37)],这引发了关于此类模型在设计和上下文中可靠性的质疑。例如医学领域的幻觉现象 [15 (https://arxiv.org/html/2607.09076#bib.bib38)],可能致命。
本文介绍了一种神经代理控制框架,通过将基于LLM的规划器与时间序列基础模型相结合,在工业物联网环境中实现基于物理原理的代理控制。我们工作的核心贡献是反事实物理注入机制,它将LLM指定的动作嵌入时间序列基础模型的数值输入空间。该框架不是更新或微调TimesFM的内部状态,而是使用累积线性注入来扰动最近的历史窗口,模拟在一定时间段内应用动作的效果。因此,在实际执行任何动作之前,TimesFM哨兵可以充当基于物理原理的世界模型,预测任何语义控制动作将如何改变系统轨迹。
对于提出的工作,我们使用安全水处理(SWaT)[19 (https://arxiv.org/html/2607.09076#bib.bib10),9 (https://arxiv.org/html/2607.09076#bib.bib41)] 数据集进行了实验。实验重点研究了在多种注入攻击模式下的非线性罐液位变量LIT301。神经代理循环旨在自主识别新风险,制定反事实控制策略,并拒绝有风险或幻觉性的动作。本文的主要贡献如下:
1. 我们提出了一种新颖的**神经代理控制框架**,通过将基于LLM的规划器与基于物理原理的时间序列基础模型相结合,明确区分了语义推理与物理控制,适用于物联网系统。
2. 我们引入了一种**反事实物理注入**机制,将LLM生成的语义控制动作转化为对未来预测的数值扰动。这使得无需微调基础模型即可对提议动作进行确定性验证。
3. 我们基于最坏情况风险最小化,制定了一种确定性的幻觉拒绝策略,确保在执行前自动拒绝不安全或无效的LLM提议动作。
4. 我们在SWaT数据集上展示了所提出框架的有效性,表明与LSTM和TCN模型相比,在随机攻击场景中能更好地预防越界事件并降低风险。
本文的其余部分组织如下。相关工作在第II节讨论。第III节提供了深度学习模型的技术概述。第IV节包含所提出框架的方法论和算法。第V节实验部分包含数据集和深度学习架构的信息。第VI节展示实验结果。第VII节讨论神经代理循环的可解释性和局限性。第VIII节总结全文并展望未来工作。
## II. 相关工作
为了更有效地将外生变量纳入时间序列预测,TimeXer [23 (https://arxiv.org/html/2607.09076#bib.bib6)] 提出了一种模块化变换器架构。TimeXer在常见基准如ETT、Weather和Electricity上的测试中优于PatchTST、FEDformer和Informer等前沿模型。在长期预测任务中,MSE提升高达23.5%。结果显示了在单变量和多变量环境中的稳定改进。然而,TimeXer更复杂的架构增加了计算成本,可能使其在资源受限的环境中不太实用。
Qiu等人 [21 (https://arxiv.org/html/2607.09076#bib.bib7)] 提出了另一种技术,即基于分解的损失函数,利用指数移动平均(EMA)分别对趋势和季节成分进行建模,以改进时间序列预测。当集成到PatchTST [20 (https://arxiv.org/html/2607.09076#bib.bib24)]、iTransformer [18 (https://arxiv.org/html/2607.09076#bib.bib27)] 以及基础模型GPT4TS [25 (https://arxiv.org/html/2607.09076#bib.bib26)] 和CALF [17 (https://arxiv.org/html/2607.09076#bib.bib23)] 中时,DBLoss在八个真实世界数据集(包括ETT、Weather、Electricity和Traffic)上持续提升了性能。例如,在ETTh1上,它将PatchTST的MSE从0.439降至0.423;在ETTm1上从0.361降至0.344,并在不同预测范围内取得了类似的增益。DBLoss还增强了少样本微调和零样本泛化能力。然而,超参数α(平滑因子)和β(季节-趋势权重)会影响其性能,需要针对每个数据集和模型进行调整。
类似地,Kim等人 [15 (https://arxiv.org/html/2607.09076#bib.bib38)] 测试了11个通用型和医学专用型LLM,针对七项对幻觉敏感的临床推理和检索任务,构建了医学幻觉基准和基于基础模型的评估框架。他们的发现表明,通用模型如Gemini 2.5 Pro通过思维链(CoT)提示实现了高达97%的无幻觉响应,而医学专用模型如MedGemma仅达到28.6%–61.9%,即使采用缓解技术,幻觉仍在27–50%的案例中持续存在。
Bhattacharjee等人 [4 (https://arxiv.org/html/2607.09076#bib.bib13)] 提出了一种零样本LLM引导的反事实生成框架,其中提示大语言模型生成语义上合理的反事实文本示例,用于评估NLP分类器而无需特定任务的训练数据。然而,尚不清楚这种零样本、LLM驱动的反事实策略在与网络物理系统的实时控制结合时表现如何,因为Bhattacharjee等人 [4 (https://arxiv.org/html/2607.09076#bib.bib13)] 的方法主要集中在静态NLP模型的离线评估上,缺乏基于物理或动态的验证层。
Ang等人 [1 (https://arxiv.org/html/2607.09076#bib.bib15)] 同样引入了TS-Agent,一个模块化的基于LLM的代理框架,用于自动化金融时间序列工作流。他们在多种预测和合成生成任务(如股票、加密货币和波动率序列)上对TS-Agent进行了实证评估。作者的方法涉及应用一个带有可执行模型代码的规划器代理,以及一个基于先前模型选择、代码优化和超参数调优的结构化知识库。然而,该方法是在离线环境下以代码级优化方式执行的,这留下了关于代理行为及其在安全关键情况下是否表现更佳的开放性问题。
## III. 技术背景
### III-A. LSTM和TCN
长短期记忆网络(LSTM)[11 (https://arxiv.org/html/2607.09076#bib.bib42)] 是循环神经网络(RNNs)的一种变体,采用带有门控的架构设计来解决梯度消失问题。LSTM的基本架构包括一个记忆单元以及输入门、输出门和遗忘门,用于控制信息流。时间卷积网络(TCNs)是用于序列建模的卷积架构,采用因果扩张卷积和残差连接来捕获长期时间依赖 [2 (https://arxiv.org/html/2607.09076#bib.bib46)]。
### III-B. Google TimesFM和Gemini 2.5 Flash Lite
TimesFM是一种用于时间序列预测的基础模型,采用基于变换器的仅解码器架构,在多种大规模时间序列数据集上训练 [6 (https://arxiv.org/html/2607.09076#bib.bib3)]。TimesFM在包含1000亿真实世界数据的时间序列语料库上进行预训练。Gemini 2.5 Flash-Lite [7 (https://arxiv.org/html/2607.09076#bib.bib49)] [8 (https://arxiv.org/html/2607.09076#bib.bib50)] 是一种稀疏混合专家变换器,可接受文本、图像、音频和视频输入,上下文长度高达100万tokens,并生成高达64K tokens的文本输出,面向高容量、延迟敏感的应用,如代理工作流、代码辅助和检索增强生成。
## IV. 方法论
参见图1:神经代理系统流程图
所提出的架构——神经代理循环(流程图1 [https://arxiv.org/html/2607.09076#alg1])作为一个两阶段控制系统运行。它将语义推理器(即规划师)与数值物理引擎(即哨兵)集成在一起,对具有多变量时间序列数据的系统进行闭环控制。算法1 [https://arxiv.org/html/2607.09076#alg1] 介绍了神经代理反事实控制循环。它结合了时间序列预测、检索增强推理和确定性物理模拟来做出安全关键决策。
**算法1** 神经代理反事实控制循环
0: 历史窗口 X_t ∈ R^W, 预测范围 H, 安全阈值 θ, 系统手册 M
0: 最优控制动作 a*
1: 初始化:
2: F ← TimesFM (哨兵); G ← Gemini-2.5-Flash (规划师)
3: 步骤1: 被动哨兵监控
4: Ŷ_base ← F.forecast(X_t, horizon=H); R_base ← max(Ŷ_base)
5: if R_base < θ then
6: return "监控" {系统安全}
7: endif
8: 步骤2: 主动代理干预
9: TargetID ← ExtractID(X_t)
10: Context ← RetrieveRAG(M, TargetID)
11: Prompt ← Construct(X_t, R_base, θ, Context)
12: 规划师提议 k 个策略
13: S ← G.generate_strategies(Prompt) {S = {s1, ..., sk}}
14: a* ← "监控"; R_min ← R_base
15: for all s_i ∈ S do
16: 步骤3: 可行性验证
17: if ¬IsFeasible(s_i) then
18: continue {拒绝不可行的动作}
19: endif
20: 步骤4: 反事实物理注入
21: Ŷ'_i ← Ŷ_base; μ, δ ← s_i.magnitude, s_i.duration
22: for t ← 0 to H-1 do
23: if t < δ then
24: 干预期间的累积排水效应
25: ŷ'_t ← ŷ_t + μ·(t+1)
26: else
27: 干预结束后维持排水水平
28: ŷ'_t ← ŷ_t + μ·δ
29: endif
30: endfor
31: 步骤5: 确定性风险评估
32: R_sim ← max(Ŷ'_i)
33: 步骤6: 安全验证
34: if R_sim < θ then
35: a* ← s_i {接受安全动作}
36: R_min ← R_sim
37: else
38: if R_sim < R_min then
39: R_min ← R_sim {跟踪最低峰值}
40: endif
41: endif
42: endfor
43: return a*
### IV-A. 步骤1:被动哨兵监控
与在传感器处于正常范围时依赖规划师不同,神经代理哨兵首先充当一个沉默的监控数字孪生。在运行时代价最小的情况下,TimesFM被动地预测多个步骤并检查预测峰值是否低于阈值。该基础模型具有快速确定性推理的能力,并且不需要任何提示或LLM交互。这种选择避免了不必要的轮询,并减少了推理延迟。正如我们在算法1的第4-7行中提出的,收集历史窗口X_t并馈送到TimesFM以获得预测Ŷ_base。然后计算预测峰值R_base = max(Ŷ_base)。如果R_base小于安全阈值θ,系统是安全的,我们返回“监控”状态。如果R_base ≥ θ,系统进入主动代理状态并移至步骤2。
### IV-B. 步骤2:主动代理干预
一旦哨兵检测到潜在风险,控制权将移交给规划师进行语义分析和动作生成。为了生成上下文感知的风险缓解策略,规划师首先提取目标传感器ID(例如LIT301)并使用检索增强生成(RAG)从系统手册中检索特定上下文。提示包含当前的预测风险(R_base)、安全阈值(θ)以及检索到的操作约束。规划师生成k个语义动作,每个动作包含一个目标变量(字段)、一个幅度(代表目标控制信号的强度)和一个持续时间(控制应用的时间步长数)。这些动作反映了文本化的领域知识,例如“稍微打开排水阀以降低液位”。从LLM返回一个JSON格式的动作字典,包含键“target”、“magnitude”、“duration”。例如:
```
{"action": "open drain valve", "target": "LIT301", "magnitude": -0.02, "duration": 3}
```
### IV-C. 步骤3:可行性验证
在将任何动作提交给物理模拟之前,神经代理循环会应用可行性过滤器。任何动作如果:(1)从字典中缺少“target”、“magnitude”或“duration”键;(2)具有数值为null、NaN或无穷大的幅度/持续时间;(3)幅度或持续时间超出物理上合理的范围(例如幅度超出系统约束),都将被立即拒绝。这确保了只有格式正确的提案才能进入安全关键的物理注入和验证阶段。
### IV-D. 步骤4:反事实物理注入
被接受的动作随后进入反事实物理注入机制。该机制将LLM指定的语义动作翻译成基础模型的受控数值扰动。关键思想是:由于TimesFM经过大量真实世界数据训练,其潜在结构隐含地编码了物理动态。因此,不是微调模型,而是我们通过累积线性注入来扰动预测窗口Ŷ_base,模拟动作对系统轨迹的影响。具体来说,给定幅度μ(负值表示降低,正值表示升高)和持续时间δ(动作积极影响的步数),构建修改后的预测序列Ŷ'_i。对于步骤t从0到min(δ - 1, H - 1),ŷ'_t = ŷ_t + μ·(t+1)(模拟累积效应)。对于t ≥ δ,ŷ'_t = ŷ_t + μ·δ(保持效应)。这种机制使得哨兵能够模拟任何提议动作的“假设”情景,而无需实际执行,从而在数值和确定性层面上预测未来系统状态。
### IV-E. 步骤5和6:确定性风险验证与决策
物理注入完成后,对修改后的预测序列计算模拟风险R_sim = max(Ŷ'_i)。这是一个确定性函数,没有随机性;完全相同的输入总是产生完全相同的输出。然后我们应用无幻觉的动作选择逻辑:如果R_sim < θ,该动作是安全的,并被选为最优动作a*。如果R_sim ≥ θ,动作被拒绝,系统默认回退到“监控”状态。然而,为了风险感知决策,我们还跟踪所有动作中的最小模拟峰值R_min。通过这种设计,LLM规划师无法覆盖哨兵的决定;哨兵充当基于物理的看门狗,强制要求任何提议的动作必须将预测峰值降至阈值以下。如果所有动作都不满足条件,系统默认输出“监控”并继续被动监控,确保在不确定情况下倾向于保守运行。相似文章
保障AI代理的未来安全
DeepMind推出了AI Control Roadmap,这是一个深度防御框架,用于保护内部AI代理免受潜在的不对齐问题的影响,将其视为内部威胁,并实施分层检测、预防和响应措施。
PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统
本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。
遏制缺口:已部署的自主AI框架如何未能满足面向公众的安全要求
本文审计了LangChain、AutoGPT和OpenAI Agents SDK在架构安全保证方面的表现,发现它们均未原生符合遏制原则,并展示了内存投毒如何导致持续性失败;文中还引入了轻量级机制以消除此类攻击。
AI代理中的操作幻觉与安全漂移
本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。
科学领域的代理型AI实验
本文介绍了两个代理型AI框架:DeepTS/DeepCollector和DeepScribe,它们利用混合本地-云端架构和大语言模型,自动化科学工作流程,包括时间序列数据整理以及将物理讲座转化为结构化报告。