CRAFT: AI原生6G RAN中事前可解释性的微调

arXiv cs.LG 论文

摘要

该论文提出了CRAFT,一种以数据为中心的方法,用于微调小语言模型,以在AI原生6G RAN中实现事前可解释性,与现有方法如GRPO相比,实现了更高的准确性和能效。

arXiv:2609.00590v1 公告类型:新 摘要:下一代移动网络被设想为完全AI原生,AI-RAN架构嵌入小语言模型(SLMs)以对实时遥测数据进行推理。电信LLM的最先进训练范式,例如基于精选指令数据的RANSTRUCT风格监督微调(SFT),仅限于事后合理化。在这里,解释(如果产生)是在决策之后或独立于决策生成的,使得决策过程不可审计。事前推理,即在输出标签之前产生因果推理轨迹,是更可取的,更广泛的LLM推理文献通过强化学习方法如Group Relative Policy Optimization (GRPO) 在这方面取得了实际进展。我们观察到,将这一方法移植到电信环境中会遇到冷启动障碍:SLMs要么学会输出所需格式,要么学会预测标签,但很少能同时做到。我们识别出这一障碍,并提出了CRAFT,即通过微调实现冷启动推理对齐,这是一种以数据为中心的方法,可自主生成经过验证的(输入、轨迹、标签)三元组数据集。CRAFT使用低秩适应(LoRA)在这些验证数据上微调SLMs,所需计算资源和时间远少于基于GRPO的方法。在TRACTOR和IC xApp电信数据集上,CRAFT的准确率和F1分别高达86.5%和94.6%,且无解析失败,而直接GRPO和SFT+GRPO的F1未超过28%和53.5%,并有多次解析失败。我们进一步表明,CRAFT初始化的策略为后续GRPO微调提供了稳健基础,因为在不同的奖励函数下,性能保持一致且无解析失败。最后,我们证明CRAFT比基于GRPO的基线消耗少59%的能量,使其成为6G RAN中可部署、可审计AI的可持续路径。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:17

# CRAFT:通过微调优化AI原生6G RAN的事前可解释性  
来源:https://arxiv.org/html/2609.00590  
作者:Vijay K Shah  
隶属机构:NextG Wireless Lab,北卡罗来纳州立大学,美国罗利  

###### 摘要  
下一代移动网络被设想为完全AI原生的,其中AI-RAN架构嵌入小型语言模型(SLMs),以对实时遥测数据进行推理。当前电信LLM最前沿的训练范式(以RANSTRUCT风格的监督微调(SFT)为代表,基于精选的指令数据进行训练)仅限于**事后**合理化。这种解释即使产生,也是在决策之后或独立于决策生成的,使得决策过程无法被审计。而**事前推理**——在输出标签之前生成因果推理链——是更可取的方式。更广泛的LLM推理文献通过强化学习方法(如分组相对策略优化(GRPO))已在这一方向上取得实质性进展。然而,我们发现将此方法移植到电信场景时会遇到**冷启动壁垒**:SLMs要么学会输出所需格式,要么学会预测标签,但很少能同时做到。我们识别了这一壁垒,并提出CRAFT(Cold-start Reasoning Alignment via Fine-Tuning,通过微调实现冷启动推理对齐),这是一种以数据为中心的方法,可自主生成经过验证的(输入、推理链、标签)三元组数据集。CRAFT使用低秩适应(LoRA)在此验证数据上微调紧凑的SLMs,与基于GRPO的方法相比,所需的计算资源和实际时间显著减少。在TRACTOR和干扰分类(IC)xApp电信数据集上,CRAFT分别实现了高达86.5%和94.6%的准确率和F1分数,且无解析失败。而直接使用GRPO和SFT+GRPO的方法则未能超过28%和53.5%的F1分数,并出现多次解析失败。我们进一步证明,CRAFT初始化的策略可作为后续GRPO微调的稳健基础,因为在不同的奖励函数下,其性能保持稳定且无解析失败。最后,我们展示CRAFT比基于GRPO的基线方法节省59%的能耗,为在6G RAN中部署可审计、可持续的AI提供了可行路径。  

###### 关键词:O-RAN, AI-RAN, LLM训练, xApps, rApps, 推理, 流量分类, 干扰分类  

## I 引言  
向6G网络的演进被广泛视为向完全AI原生无线接入网络(AI-RAN)的范式转变[1,2,3],其中智能不是附加于网络之上,而是嵌入其控制回路中。这一愿景的核心是O-RAN联盟的开放式解耦架构,该架构开放了托管xApps和rApps的RAN智能控制器(RICs),支持对资源分配、切片和干扰缓解进行自动化、实时决策[4]。随着AI-RAN的成熟,这些组件越来越多地被期望以代理而非静态分类器的形式运作,这一趋势体现在新兴研究如电信模型上下文协议(TeleMCP)[5,4]和GENESIS[6]中,两者都为在现有硬件内解决端到端电信任务的真正多代理电信系统开辟了道路。  

这一转变为面向边缘性能设计的小型语言模型(SLMs,参数量在1亿至50亿之间[7])提出了新要求,这些模型将填充xApps和rApps。它们不仅需要读取关键性能指标(KPI)遥测数据并输出正确操作,还需提供人类可读的理由,以便网络运营商在信任决策之前进行审计[4]。然而,现有最先进的电信专用语言模型方法并未围绕这一需求构建。例如RANSTRUCT[8]和TelecomGPT[9]等方法直接微调模型以直接输出答案,不附带推理链;而像AI5GTest[10]这样确实生成解释的代理系统,也仅在决策**之后**才生成解释。这种顺序是有问题的:因为解释是在预测之后或独立于预测生成的,无法保证所述理由确实是驱动输出的依据,且决策过程本身仍然无法审计。更糟的是,当这些模型被提示在提交标签**之前**进行推理时,它们往往会崩溃,无法输出有效标签,而不是进行有效推理。  

更广泛的LLM推理文献为避免这种失败模式提供了模板。思维链提示[11]和强化学习方法(如分组相对策略优化(GRPO)[12])在引导真正的事前推理方面取得了实质性进展——在这种推理中,首先生成因果推理链,然后从中推导出标签,而非相反。然而,将这种方法天真地移植到电信场景时,会遇到我们所称的**冷启动壁垒**:SLMs缺乏解决电信任务的有效推理链的先验知识,因此当GRPO的奖励信号被迫同时优化正确格式、非平凡推理内容和标签准确性时,这些目标在训练早期就会冲突,导致探索完全失败。实践中,我们观察到,采用此方法的SLMs最多只能满足其中一个目标,即输出格式或标签。  

为解决这一问题,我们提出CRAFT(Cold-start Reasoning Alignment via Fine-Tuning,通过微调实现冷启动推理对齐),这是一种以数据为中心的方法,通过自主构建经过验证的(输入、推理链、标签)三元组数据集,从而完全避开强化学习的探索困难,然后使用普通的低秩监督适应方法在该数据集上微调紧凑的SLMs。由于验证在离线构建数据集时一次性完成,而非在策略优化期间在线进行,CRAFT所需的计算资源和实际时间显著少于基于GRPO的方法。在TRACTOR和IC xApp电信数据集上,CRAFT分别实现了高达86.5%和94.6%的宏观F1分数,且无解析失败。而直接使用GRPO和SFT+GRPO的基线方法则未能超过28%和53.5%的F1分数,并表现出较高的解析失败率。我们进一步证明,CRAFT初始化的策略为从业者可能仍希望应用的后续任何GRPO微调提供了稳健基础,在不同的奖励公式下,其准确性和格式合规性保持稳定,并且CRAFT比基于GRPO的基线方法节能高达59%,为在6G RAN中部署可审计、可持续的AI提供了可行路径。  

## II 背景  
### II-A 电信领域的大语言模型  
越来越多的研究表明,语言模型正在成为电信研发和运营的标准组件,而非仅仅是研究兴趣点。在评估方面,ORAN-Bench-13K[13]贡献了近14,000道精选的选择题,这些题目源自O-RAN规范文档,并显示通用LLM在O-RAN特定知识方面仍有很大提升空间,这推动了检索增强和微调替代方案的研究。TeleResilienceBench[14]探讨了另一种能力(对于AI-RAN而言,可能更具运营相关性):当模型从先前步骤或上游代理继承部分完成或已有缺陷的推理链时,是否能恢复,而不是仅从干净起点进行评估;即使它测试的最强模型也只在不到三分之一的情况下正确恢复,这突显了当前的推理行为距离在实际生产流水线中可靠运行还有多远。  

在系统方面,AI5GTest[10]和GENESIS[6]都使用协作LLM代理来自动化传统上需要大量手工工程的工作:AI5GTest用于规范感知的一致性测试和验证O-RAN组件是否符合3GPP和O-RAN规范;GENESIS则用于更广泛的RAN研发任务,包括特性综合、测试、强化、优化和安全性,并在生产O-RAN测试台上通过空口实验进行端到端验证。最后,TelecomGPT[9]提出了一种持续预训练、指令调优和对齐调优流程,用于将通用LLM适配于电信领域,同时提出了电信数学建模、开放式问答和代码任务的新基准,并展示了所得模型在电信特定评估中优于同等规模的通用LLM。  

总的来说,这一系列研究有力地证明了电信专用语言模型已经产生价值,并正在成为AI-RAN流水线的核心。而相对未被充分探讨的是(也是我们在此解决的问题),不是这些模型能否产生决策,而是它们能否产生其推理链与该决策具有因果(而非仅仅是修辞)关联的决策。RANSTRUCT和TelecomGPT通过低秩适应(LoRA)实现了语言模型的训练操作。LoRA冻结预训练权重W₀∈Rᵈˣᵏ,并注入可训练的低秩矩阵B∈Rᵈˣʳ,A∈Rʳˣᵏ,其中r≪min(d,k):  
h = W₀x + (α/r)BAx, (1)  
其中α是缩放因子。这种方法在标签预测准确性方面表现优异,但无法提供可审计的推理链机制。  

### II-B 思维链推理  
思维链(CoT)[11]提示被广泛认为是LLM推理的第一步,通过在最终答案前引出中间推理步骤,提高了复杂任务的准确性。形式上,模型不是直接建模标签pθ(y|x),而是将生成分解为pθ(t,y|x) = pθ(t|x)pθ(y|x,t),因此首先采样推理链t,然后标签y在输入x和推理链的条件下解码。自一致性[15]解码通过采样K个独立推理链t⁽¹⁾,...,t⁽ᴷ⁾∼pθ(t|x),为每个链解码一个标签y⁽ᵏ⁾∼pθ(y|x,t⁽ᵏ⁾),并通过多数投票聚合它们(ŷ = argmax_y Σₖ₌₁ᴷ 𝟙[y⁽ᵏ⁾=y]),进一步提高了可靠性。  

由于t在y之前生成,且y以t为条件,因此推理链可以是输出标签的因果上游,而非事后附加的修饰。与SHAP[16]或LIME[17]等事后解释技术(它们为已固定的预测ŷ=f(x)拟合理由,因此无需反映产生ŷ的实际机制)相比,事前推理链可以在精确、可测试的意义上成为**因果信息性的**:我们仅在标签可以从推理链和输入中正确恢复时保留推理链,即如果pθ(y|x,t)将最高概率分配给真实标签。  

### II-C 分组相对策略优化  
从提示思维链(CoT)到训练模型可靠地产生CoT的转变,在LLM推理文献中遵循了一条有据可查的路径,从SFT到强化学习。LLM的强化学习最初由近端策略优化(PPO)[18]推广,PPO训练一个值网络与策略πθ并行,以估计部分生成的预期回报,并将其作为基线,用于比较实现的回报。由于该评论网络与策略规模相当,PPO可能显著增加训练的内存占用。GRPO[12]完全移除了评论网络,并已成为推理导向训练的**事实标准**:对于每个输入x,它从行为策略πθ_old中采样一组G个输出{oᵢ}ᵢ₌₁ᴳ,用奖励rᵢ对每个输出评分,并使用该组本身作为基线,给出组归一化优势Â_{i,ℓ} = (rᵢ - mean(r)) / (std(r) + δ), (2)  
其中r=[r₁,...,r_G],δ>0是原始公式实现中添加的一个小的稳定常数。在结果监督下,该标量会广播到oᵢ的每个tokenℓ。策略在从PPO继承的裁剪代理目标上更新,并在损失中直接添加权重为β的KL惩罚,将πθ锚定到固定参考策略π_ref(通常是初始检查点)。奖励函数通常由多个验证器计算项的加权组合构成,这些项分为两大类。第一类关注**形式**:输出是否遵循所需模板,其中包含的推理链是否非平凡(而非空或退化)。这些项与任务无关,因为目标结构由提示而非问题固定。第二类评分**正确性**,这是唯一随任务变化的部分,对于分类问题可以是准确性,对于KPI回归或预测任务可以是基于误差的有界分数,或对于代码生成LLM可以是可执行检查的通过率。  

## III CRAFT  
现在我们介绍CRAFT。在高层次上,CRAFT通过合成构建一组(KPI输入、推理链、标签)三元组数据集来打破冷启动循环,其中推理链被**验证**为对标签具有因果信息性(而非仅仅是听起来合理),然后使用普通监督学习在该数据集上微调目标SLMs。我们首先通过实证说明为什么这一引导步骤是必要的(第III-A节[链接]),然后形式化验证过程和由此产生的训练目标(第III-B节[链接])。  

### III-A 动机  
为通过实证说明CRAFT的动机,我们在TRACTOR数据集上(完整数据集详情见第IV节[链接])评估了四种朴素的训练策略,使用Qwen 3.5 2B作为基础模型,每个KPI窗口按特征摘要统计序列化到提示中。第一种策略是仅标签SFT,本质上是RANSTRUCT的方案,模型在输入-标签对上训练,完全没有推理链。第二种策略在输出模板中添加了一个事后字段,但监督……

相似文章

应用于大语言模型的可解释性研究:对比分析

arXiv cs.CL

一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。

Switchcraft:用于智能体工具调用的 AI 模型路由

arXiv cs.AI

本文介绍了 Switchcraft,这是首个专为智能体工具调用优化的 AI 模型路由器,旨在降低推理成本。通过使用轻量级的 DistilBERT 分类器,它在保持高工具使用准确性的同时,实现了显著的成本节约。