基于规则对齐的小型语言模型与多智能体自校正的闭环控制
摘要
本文探讨了使用基于GRPO再训练的紧凑型小型语言模型(Qwen2.5-1.5B),并结合验证器引导的校正循环,用于自主工业控制。该框架实现了高对齐精度和低延迟,展示了在边缘部署的实际可行性。
arXiv:2607.09713v1 Announce Type: new
摘要:实现自主工业运营的一个关键步骤是能够根据自然语言需求规范创建和重新配置控制策略,且无需或极少需要手动重新设计。在此背景下,当与一个能够执行前检查生成候选动作的工厂感知验证器(例如数字孪生)配对时,由AI智能体生成策略是一条可信的路径。然而,实际部署受到推理延迟和计算占用空间的限制:大型云模型通常对于边缘闭环使用而言太慢、不透明或对数据敏感。本研究探讨了一种紧凑的小型语言模型(SLM)是否可以被重新训练用于控制推理,并嵌入到验证器引导的校正循环中。我们使用了通过组相对策略优化(GRPO)对齐的Qwen2.5-1.5B模型,结合了(i)动作智能体,(ii)符号/数字孪生风格的验证层,以及(iii)重新提示智能体,该智能体迭代地将输出导向有效动作。在随机热控制仿真中(30个实验,每个500步),该框架实现了91.5%的平均动作对齐精度(各案例86.3%–100%),平均推理延迟为3.84秒。在符号重新映射下,它保持了95%的范围内率,表明尽管标记级别一致性降低,仍具有稳健的物理调节能力。这些结果支持SLM+验证器架构作为边缘可重构自主控制的实用路径。
查看缓存全文
缓存时间: 2026/07/14 04:16
# 基于规则对齐的小语言模型与多智能体自校正的闭环控制 来源:https://arxiv.org/html/2607.09713 王宇晨
谢菲尔德大学计算机科学学院
英国谢菲尔德
ywang1016@sheffield\.ac\.uk
Javal Vyas
帝国理工学院化学工程系
英国伦敦
j\.vyas24@imperial\.ac\.uk
刘彤
谢菲尔德大学计算机科学学院
英国谢菲尔德
t\.liu@sheffield\.ac\.uk
Mehmet Mercangöz
帝国理工学院化学工程系
英国伦敦
m\.mercangoz@imperial\.ac\.uk
###### 摘要
实现自主工业运行的关键一步,是能够根据自然语言需求规范创建和重新配置控制策略,同时尽量减少或无需手动重新设计。在此背景下,由AI智能体生成策略,若与能够执行前检查候选动作的工厂感知验证器(例如数字孪生)配合,则是一条可行的路径。然而,实际部署受到推理延迟和计算开销的制约:大型云端模型对于边缘闭环应用而言,往往速度过慢、不透明或对数据敏感。本研究探讨了是否可以对紧凑型小语言模型(SLM)进行重新训练,使其具备控制推理能力,并嵌入到由验证器引导的校正循环中。我们采用通过组相对策略优化(GRPO)对齐的Qwen2.5-1.5B模型,并结合了(i)动作智能体、(ii)符号/数字孪生风格的验证层,以及(iii)在验证失败时迭代引导输出趋向有效动作的重新提示智能体。在随机化热控制仿真中(30个实验,每个500步),该框架在3.84秒的平均推理延迟下,实现了91.5%的平均动作对齐准确率(各案例范围为86.3%–100%)。在符号重新映射下,它保持了95%的在范围内率,表明尽管令牌级一致性降低,但仍具有稳健的物理调节能力。这些结果支持了SLM+验证器架构作为边缘可重构自主控制的一条实用路径。
**关键词:** 自主系统,小语言模型,边缘AI,生成式AI
## I. 引言
自主工业运行的一个核心要求,是能够根据高层次的自然语言需求规范*创建和重新配置控制策略*,同时尽量减少手动重新设计。这在目标和约束随时间演变(例如能源优先级、安全包络和操作策略)的环境中尤为重要。在此背景下,由AI智能体生成策略,若与能够执行前检查候选动作的工厂感知验证器(例如数字孪生)配合,则是一条可行的路径[3 (https://arxiv.org/html/2607.09713#bib.bib30)]。
传统的工业控制架构对于确定性数值调节非常有效,但在需要快速整合符号化操作意图时,灵活性则不足。将新的专家指令转换为部署逻辑通常需要手动重新设计规则、监督层或互锁,这减慢了重新配置速度并增加了工程开销。这在高层操作意图与底层控制执行之间造成了持续的差距。
语言模型提供了一个有前景的接口来弥合这一差距,因为它们能够解析和操作化自然语言指令,并在推理过程中支持迭代自校正[18 (https://arxiv.org/html/2607.09713#bib.bib15), 19 (https://arxiv.org/html/2607.09713#bib.bib24)]。然而,在闭环工业工作流中部署云托管的大语言模型(LLMs)仍然具有挑战性:API依赖引入了可变端到端延迟,而外部数据传输则引发了对敏感运营遥测数据的治理和主权问题[15 (https://arxiv.org/html/2607.09713#bib.bib28), 12 (https://arxiv.org/html/2607.09713#bib.bib27)]。这些问题对于边缘和离线自主性尤为限制。
本研究探讨了是否可以对紧凑型小语言模型(SLM)进行训练,使其具备面向控制的推理能力,并嵌入到由验证器引导的校正循环中。我们开发了一个基于Qwen2.5-1.5B[8 (https://arxiv.org/html/2607.09713#bib.bib29)]的本地架构,其中策略行为通过组相对策略优化(GRPO)[4 (https://arxiv.org/html/2607.09713#bib.bib12)]进行对齐。这种基于强化学习的对齐的一个关键优势是模型自主生成其自身的思维链(CoT)。虽然采用了简短的热启动蒸馏,但这严格用于格式对齐,而非任务特定的记忆。此外,该框架在纠正交互方面以零样本能力运行;尽管GRPO仅用于增强智能体的数值和逻辑推理,但动作智能体在训练期间从未暴露于多样化的重新提示线索。尽管如此,它展示了一种基于此类纠正反馈动态更新其决策的新兴能力。
该控制器由三个协作组件实现:(i)提出控制动作的动作智能体,(ii)检查动作有效性的符号/数字孪生风格验证器,以及(iii)在验证失败时提供纠正指导的重新提示智能体。该设计旨在实现推理能力、延迟和边缘可部署性之间的实际平衡。
**贡献:** 主要贡献有三点:(1)**规则对齐的SLM策略学习**,提供了一个使用GRPO将1.5B SLM与热控制逻辑对齐的流水线;(2)**零样本验证器引导的推理循环**,使紧凑型SLM能够在没有显式纠正训练的情况下展示新兴的校正能力;(3)**实证评估**,在随机化仿真中,在接口扰动下展示了强大的物理调节能力(95% IRR)。
## II. 相关工作
### II-A LLM驱动的自主控制及其优势
传统的自动化系统主要依赖僵化的硬编码逻辑来管理工业过程。尽管这些系统在数值调节方面高度可靠,但在整合复杂的符号化专家意图方面存在困难。近年来的研究已转向基于LLM的自主智能体,其中模型充当“推理引擎”来弥合这一差距。这种范式转变已在实验室发现[1 (https://arxiv.org/html/2607.09713#bib.bib6)]、数字工作流[9 (https://arxiv.org/html/2607.09713#bib.bib1)]和机器人奖励工程[11 (https://arxiv.org/html/2607.09713#bib.bib13)]中展现出巨大潜力。
### II-B 增强语言模型中的数值推理
热管理需要精确的数值比较和基于阈值的逻辑,而标准LLM在这些领域常常面临“随机漂移”或计算错误的问题[14 (https://arxiv.org/html/2607.09713#bib.bib16)]。当前缓解此问题的策略包括:
* **强化学习(RL):** 像PPO,特别是组相对策略优化(GRPO)[4 (https://arxiv.org/html/2607.09713#bib.bib12), 5 (https://arxiv.org/html/2607.09713#bib.bib19)]等技术,已出现用于将模型输出与可验证奖励对齐,强化数值决策背后的逻辑一致性。
* **自校正与递归推理:** 为了稳定控制输出,最近的研究采用了外部验证循环和重新提示智能体[17 (https://arxiv.org/html/2607.09713#bib.bib31), 16 (https://arxiv.org/html/2607.09713#bib.bib2)]。然而,纯粹的外部设计常常缺乏实时稳定性所需的内在逻辑深度。像**自学习推理器(STaR)** [20 (https://arxiv.org/html/2607.09713#bib.bib17)]这样的框架通过使模型能够基于成功结果迭代地改进其自身的推理链(思维链)来解决这个问题。这使得模型能够在训练期间内化复杂逻辑——我们通过使用GRPO在小型架构中培养“顿悟时刻”[4 (https://arxiv.org/html/2607.09713#bib.bib12)]来扩展这一演进,确保它们在没有繁重外部监督开销的情况下正确推理。
* **工具利用:** 尽管智能体可以调用外部计算器[13 (https://arxiv.org/html/2607.09713#bib.bib7), 7 (https://arxiv.org/html/2607.09713#bib.bib5)],但由此产生的通信延迟和不稳定性使得这种方法并不适合所有问题。
### II-C 用于边缘部署的小语言模型(SLMs)
尽管大语言模型(LLMs)拥有卓越的推理能力,但其高昂的推理延迟和部署成本阻碍了实时工业集成。小语言模型(SLMs)在适当优化后,正被探索以在专门任务中实现功能性性能,同时提供在热控制中本地执行的潜力[2 (https://arxiv.org/html/2607.09713#bib.bib11)]。最近的研究强调使用SLMs作为“控制特定”智能体,内化专家经验以取代庞大通用架构[5 (https://arxiv.org/html/2607.09713#bib.bib19)]。本文通过研究通过基于GRPO的启发式内化来解决1.5B参数SLM中推理差距的可行性,来扩展这一方向。
## III. 方法论
我们的架构采用多智能体协作来确保系统的自校正。
### III-A 协作式多智能体架构
闭环系统的核心由三个专门智能体组成,分别负责决策、验证和逻辑校正的任务划分。
* **动作智能体(推理核心):** 由Qwen2.5-1.5B驱动并通过GRPO对齐,该智能体处理状态 `s_t` 和上下文,生成控制动作 `u_t` 以及思维链(CoT)推理路径。
* **验证智能体(符号护栏):** 执行严格的逻辑过滤,如果输出 `u_t` 偏离地面真值专家规则 `u_gt`,则标记为 `UNSAFE`。
* **重新提示智能体(逻辑解释器):** 同样使用Qwen2.5-1.5B,该智能体诊断 `u_t` 和 `u_gt` 之间的差异。针对动作智能体的错误分布进行微调,它构建一个关于边界或规则疏忽的语义**纠正提示 `h_t`**,以引导零样本自校正。
### III-B 控制算法
这些智能体之间的交互在算法1 (https://arxiv.org/html/2607.09713#alg1) 中形式化,并在图1 (https://arxiv.org/html/2607.09713#S3.F1) 所示的系统架构中可视化。如图所示,该框架结构化为三个功能不同的层:**推理层**(蓝色)、**符号验证层**(橙色)和**执行层**(绿色)。
**算法1** 多智能体协作控制循环
1: **输入:** 当前系统状态 `s_t`, 最大重试限制 `N_max`
2: **输出:** 已验证的控制动作 `u_t`
3: `attempt ← 0`
4: `hint ← ∅`
5: **while** `attempt < N_max` **do**
6: `u_t, CoT ← ActionAgent(s_t, hint)` ▷ 生成带有推理轨迹的动作
7: `flag ← ValidationAgent(u_t, s_t)` ▷ 检查逻辑一致性
8: **if** `flag is SAFE` **then**
9: **return** `u_t` ▷ 通过验证并输出
10: **end if**
11: `hint ← RepromptAgent(s_t, u_t)` ▷ 构建语义纠正提示
12: `attempt ← attempt + 1`
13: **end while**
14: **return** `u_t` ▷ 安全释放默认动作
### III-C 实验设置
#### III-C1 热控制逻辑规则
表格 I (https://arxiv.org/html/2607.09713#S3.T1) 总结了定义环境-动作映射的状态驱动规则。
**表格 I:** 热系统的状态驱动动作逻辑
| 系统状态 | 检查 | 动作 |
| :--- | :--- | :--- |
| A. 极端高温 | `T_cur > T_target,high` | `−Q` |
| B. 低端温度 | `T_cur < T_target,low` | `+Q` |
| C. 维护(滞环) | `T_cur ∈ [T_low, T_high] ∩ A_prev > 0` | `−Q` |
| D. 维护(滞环) | `T_cur ∈ [T_low, T_high] ∩ A_prev < 0` | `+Q` |
| E. 默认 | 所有其他适用情况 | `0` |
#### III-C2 闭环推理与验证
控制循环组织为**验证-然后-执行**流水线(算法1 (https://arxiv.org/html/2607.09713#alg1))。在每一步,候选动作首先由推理智能体提出,然后在应用于工厂之前由验证层筛选。
#### III-C3 系统动力学与环境
热环境通过一阶能量平衡方程建模:
`C dT_t/dt = UA(T_out − T_t) + a_t + ε` (1)
其中 `C` 是房间热容量,`UA` 是总体传热系数,`T_out` 是环境室外温度。控制动作从离散集合 `a_t ∈ {−2Q, −Q, 0, Q, 2Q}` 中选择,其中 `Q = 5.0` 是基本功率单位。
### III-D 算法优化:GRPO 与蒸馏
为了优化SLM的推理能力,我们采用了组相对策略优化(GRPO)后跟知识蒸馏的策略。
#### III-D1 GRPO 与奖励函数
与需要值函数 `V(s)` 的PPO不同,我们采用GRPO通过基于组的相对优势来稳定训练[4 (https://arxiv.org/html/2607.09713#bib.bib12)]。对于给定的状态 `s_t`,我们采样 `G` 个推理轨迹 `{y_1, y_2, ..., y_G}`。奖励函数 `R` 被制定为使模型与符号逻辑对齐。对于每个轨迹 `i`,根据表II (https://arxiv.org/html/2607.09713#S3.T2) 中详述的逻辑分配奖励 `r_i`。
**表格 II:** GRPO训练的奖励逻辑与惩罚映射
| 条件 | 地面真值 | 输出 | 分数 |
| :--- | :--- | :--- | :--- |
| 任务持续性(锁存) | `a_{t-1} ∈ {+Q, +2Q}` | `+Q` | 0(提前退出)−0.5 |
| | `a_{t-1} ∈ {−Q, −2Q}` | `−Q` | 0(提前退出)−0.5 |
| 严重错误 | 极性反转 | 例如 `+Q` | 例如 `−Q` −0.75 |
| | 无效格式 | 任何 | 未知 −1.0 |
| 正确执行 | `a*` | `ā = a*` | 1.0 |
优化遵循GRPO算法[10 (https://arxiv.org/html/2607.09713#bib.bib26)]。对于每个状态 `s_t`,SLM生成一组 `G=8` 个独立的推理轨迹。
#### III-D2 通过蒸馏进行动作智能体初始化
整体训练和对齐工作流程如图2 (https://arxiv.org/html/2607.09713#S3.F2) 所示。为了防止后续强化学习阶段发散,**动作智能体**经历一个使用DeepSeek-R1-671B作为教师的初始简短蒸馏阶段。遵循**逐步蒸馏**范式[6 (https://arxiv.org/html/2607.09713#bib.bib20)],智能体使用5,000条轨迹的子集学习内化结构化的推理路径(CoT)以及控制标签。此阶段提供了一个必要的“热启动”策略,确保智能体在通过GRPO优化数值精度之前保持结构化格式。
#### III-D3 迭代错误驱动蒸馏
受**STaR**(自学习推理器)框架[20 (https://arxiv.org/html/2607.09713#bib.bib17)]的启发,我们为**重新提示智能体**开发了一个迭代蒸馏流水线,形成了图2 (https://arxiv.org/html/2607.09713#S3.F2) 右侧面板所示的反馈循环。该过程分三个阶段执行:
1. **错误分析:** 在动作智能体完成GRPO优化后,我们将其部署在具有挑战性的热环境中,以收集边界情况失败轨迹。
2. **教师纠正:** 这些错误案例被输入DeepSeek-R1-671B教师模型,以生成5,000条纠正样本。
3. **顿悟时刻蒸馏:** 受“顿悟时刻”启发,重新提示智能体被微调以“Wait...”前缀启动反馈,强制执行二次验证。
参见图注
**图 2:** 分叉训练与自校正流水线,包含基于GRPO的动作优化路径(左)和迭代审计器进化路径(右)。
### III-E 符号推理的提示设计
提示结构为动作智能体和重新提示智能体独立开发。如图3 (https://arxiv.org/html/2607.09713#S3.F3) 所示,动作智能体获得一个侧重于状态解释的结构化模板,而图4 (https://arxiv.org/html/2607.09713#S3.F4) 中的重新提示智能体提示则配备了“逻辑审计器”角色。具体来说,在任何给定状态 `t` 时,审计器的提示被设计为提供关于思维链的提示(后续内容可能涉及具体的提示模板和示例,但原文在此处中断)。相似文章
基于小语言模型的闭环图算法执行:步骤准确性与展开可靠性
本文研究将小语言模型(SLMs)作为图算法执行的闭环策略,评估了多个图程序中的步骤准确性和展开可靠性。结果表明,局部决策质量与全局执行可靠性之间存在差距,尤其是在加权算法中。
语言模型虽努力仍出错:自纠正科学生成的共形预测
介绍了科学可行性控制(SFC),一种共形预测框架,为大型语言模型中的科学推理有效性提供统计保证,在PhyX物理推理上达到50.1%的准确率,优于DeepSeek-R1和GPT-4,同时将科学违规减少73%。
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
PACE: 双时间尺度自进化小语言模型智能体
PACE 提出了一种双时间尺度框架,用于小语言模型智能体的自进化,协调低风险的提示精炼与高风险的控制器逻辑更新,在多个基准上实现了高达 +9.2% 的相对提升。
小型RL控制器与大型语言模型:RL引导的测试时自适应采样
本文将大型语言模型的自适应采样建模为马尔可夫决策过程,并训练一个轻量级强化学习控制器来平衡正确性、延迟和计算成本,从而实现了更好的权衡。