TelecomGPT-R1:电信堆栈的统一开源推理器
摘要
TelecomGPT-R1-9B 是一个统一的开源电信推理器,通过涉及监督微调和强化学习的两阶段训练配方,在基准测试中实现了顶级性能。
arXiv:2608.26126v1 Announce Type: new
摘要:电信是大型语言模型(LLM)推理的高影响力领域,因为常规工程工作流需要联合依据规范性规格、操作遥测、特定供应商的故障证据以及精确的RF/网络计算。然而,当前电信中的LLM集成仍受限于双向能力差距:通用推理器往往缺乏电信特定的依据,而特定领域的电信LLM在结构化的多步骤推理方面仍有限制。为了弥合这一差距,我们发布了TelecomGPT-R1-9B,这是一个统一的开源电信推理器,在GSMA开放电信排行榜上排名顶级性能。具体来说,我们整理了一个包含67,427个示例的监督微调(SFT)语料库,围绕四个互补的推理轴:协议、知识、建模和故障。该语料库基于轴匹配的公共网络资源构建,并通过特定于轴的思维链(CoT)生成和前缀连续自验证进行增强。从Qwen3.5-9B开始,我们进一步开发了一个两阶段的后训练配方。首先,基于多教师低秩适应(LoRA)的SFT注入电信知识并诱导特定于轴的推理格式。其次,通过解耦裁剪和动态采样策略优化(DAPO)稳定的组相对策略优化(GRPO),使用四个轴对齐的二进制验证器奖励来优化策略。在七个公共电信基准测试中,TelecomGPT-R1-9B在开源电信LLM中排名第一,并实现了与最先进的闭源前沿推理器相当的七轴平均分。
查看缓存全文
缓存时间: 2026/08/28 09:18
# TelecomGPT-R1:面向电信全栈的统一开源推理模型
来源:https://arxiv.org/html/2608.26126
Bohao Wang¹²,Chenwei Wu⁴,Haoyu Li³,Hang Zou²,Yu Tian²,Lina Bariah²,Li Wei¹,Chongwen Huang¹,Yongliang Shen³,Zhaoyang Zhang¹,and Mérouane Debbah²
邮箱:\{bohaowang, 3220105244, chongwenhuang, syl, ning\_ming\}@zju\.edu\.cn,chenweiw@umich\.edu,\{bohao\.wang, hang\.zou, yu\.tian, lina\.bariah, merouane\.debbah\}@ku\.ac\.ae,weili\_xd@163\.com
###### 摘要
电信领域是大语言模型(LLM)推理应用的高价值场景,因为常规工程流程需要融合规范性标准、运行遥测数据、厂商特定故障证据及精确的射频/网络计算。然而,当前LLM在电信领域的应用仍受限于双重能力缺口:通用推理模型常缺乏电信特定的场景化知识,而专用电信LLM在结构化、多步推理方面仍存在局限。为弥合这一缺口,我们发布了TelecomGPT-R1-9B——一个统一的开源电信推理模型,在GSMA公开电信排行榜上性能领先。具体而言,我们构建了包含67,427个样本的监督微调(SFT)数据集,围绕四个互补的推理维度组织:协议、知识、建模和故障。该数据集基于各维度匹配的公开网络资源构建,并通过维度特定的链式思考(CoT)生成和前缀续写自验证进行增强。以Qwen3.5-9B为基础,我们进一步开发了两阶段后训练流程:首先通过多教师低秩适应(LoRA)SFT注入电信知识并引导特定维度的推理格式;其次通过解耦裁剪与动态采样策略优化(DAPO)稳定的分组相对策略优化(GRPO),利用四个维度对齐的二元验证奖励优化策略。在七个公开电信基准测试中,TelecomGPT-R1-9B在开源电信LLM中排名第一,其七维度平均性能可与最先进的闭源前沿推理模型相媲美。
## I 引言
大语言模型(LLM)在推理与理解领域已取得快速进展[9,8],为电信领域带来巨大潜力。强大的电信LLM可自动化广泛的工程任务,包括标准解读、协议分析、日志诊断、配置检查、无线公式验证及代码级故障排查。这种广泛的应用前景推动了越来越多面向电信的LLM、基准测试、数据集和推理工作流[19,12]的出现。然而,当前电信LLM的应用仍远未达到日常部署水平。现有LLM在静态问答(QA)任务上表现良好[12],但现实世界的电信工程需要跨多样任务和数据模态进行复杂推理。例如,诊断网络故障可能需要工程师关联3GPP流程与O-RAN配置表[5],在系统日志中追踪异常事件,验证关键性能指标(KPI)变化是否符合预期协议行为,并检查实现或配置是否违反标准定义的约束。这类工作流揭示了一个核心挑战:电信数据并非单一语言。因此,一个可部署的电信推理模型必须能跨异构源类型进行推理——标准、日志、表格、公式和代码各自需要不同的证据格式、推理模式和正确性标准。这一缺口尚未被通用推理模型或现有电信领域LLM解决。前沿推理模型如GPT-5[15]和Claude Opus 4.5[1]展示了强大的通用推理、数学和编码能力,但缺乏领域知识,且未经训练以可靠地将其推理扎根于电信特定标准、计数器、协议流程或运行证据中。模型可能生成看似连贯的推导过程,却将结构化无线接入网(RAN)日志误读为自由文本[5],混淆3GPP工作组范围,或虚构不存在的信息元、计时器、计数器和协议流程。这些失败揭示了通用推理能力与电信工程所需的密集型标准约束知识之间的不匹配。另一方面,电信专用模型提升了领域覆盖度,但它们常聚焦于静态问答、检索辅助回答或特定源任务,而非跨标准、日志、表格、公式和代码的统一推理。TelecomGPT[19]和Tele-LLMs[11]通过精选语料库、持续预训练、指令微调和任务导向对齐将通用LLM适配到电信领域,提升了领域知识、电信问答、分类及相关技术任务。WirelessMathLM[10]和ORANSight-2.0[5]进一步展示了基于可验证奖励的强化学习以及检索增强指令调优在无线数学和O-RAN理解方面的价值。然而,这些工作仍集中于特定任务族或证据源,因此留下了一个问题:如何训练一个统一策略,使其能够跨异构电信证据生成长而扎根的推理链?
因此,本工作研究一个重要但未充分探索的问题:如何构建一个能够跨异构电信任务和数据源泛化的统一电信推理模型?为此,我们发布了TelecomGPT-R1-9B——迄今为止最佳的电信推理模型。我们首先构建了包含67,427个样本的监督微调(SFT)数据集,围绕四个推理维度组织:协议、知识、建模和故障。每个维度从维度匹配的公开网络资源填充,并通过维度特定的链式思考(CoT)生成和前缀续写自验证处理,确保每个维度的推理轨迹与其证据结构对齐。我们采用两阶段后训练流程,以Qwen3.5-9B[13]为骨干模型。多教师低秩适应(LoRA)SFT首先将电信知识、响应规范和维度特定推理格式注入基础模型。随后,我们使用解耦裁剪与动态采样策略优化(DAPO)[18](一种分组相对策略优化(GRPO)的变体)在每维度二元验证奖励下进行强化学习(RL)。具体而言,我们应用非对称信任域裁剪、动态采样、token级损失聚合和SFT锚定的Kullback-Leibler(KL)正则化器来稳定RL训练并促进收敛。在GSMA公开电信排行榜的七个公开电信基准测试中,TelecomGPT-R1-9B在开源电信LLM中排名第一,并与最先进的(SOTA)闭源前沿推理模型保持可比性。我们进一步对改进统一电信推理能力的后训练设计选择进行了实证研究,并总结了数据构建、SFT和RL算法设计的实用经验,以支持该领域的未来工作。
综上,我们的贡献有三方面:
- • **新表述**:我们将电信推理表述为跨异构任务和数据模态的统一策略,其中模型必须在源特定正确性标准下跨标准、日志、表格、公式、代码和配置证据进行推理。
- • **新数据与模型**:我们公开发布TelecomGPT-R1-9B模型权重。TelecomGPT-R1-9B在GSMA公开电信排行榜的七个公开基准测试中,在开源电信LLM中排名第一。
- • **新发现**:我们识别了后训练电信推理器的实用发现,包括领域SFT在RL前的重要性、源匹配CoT生成、动态采样、验证器设计和教师多样性。
## II 方法
参见标题
图 1:两阶段TelecomGPT-R1-9B流程。阶段1通过跨四个推理维度(协议/知识/建模/故障)的维度匹配多教师CoT生成,构建包含67,427个样本的语料库。阶段2通过LoRA-SFT后接基于每维度二元验证奖励(非对称裁剪、动态采样、token级损失、KL锚定)的DAPO稳定GRPO循环,对Qwen3.5-9B进行后训练。
### II-A 数据构建
电信推理涵盖异构证据格式、推理风格和验证标准。因此,我们通过四个步骤构建训练语料库:定义推理维度、收集源材料、合成或提取问题,以及生成经验证的CoT轨迹。
#### 推理维度
我们将电信推理组织为四个维度:protocol(协议)、knowledge(知识)、modeling(建模)和fault(故障)。协议维度针对3GPP和O-RAN规范的规范性推理。知识维度针对运营商、厂商和通用电信知识的事实性与术语性问答。建模维度针对射频、排队论、网络、数学及基于代码的计算。故障维度针对基于运行RAN证据的根因分析。
#### 源材料收集
对于每个维度,我们收集公开可访问且能暴露该维度原生证据结构的资源。协议样本来自公开的3GPP规范PDF、3GPP技术报告和O-RAN联盟规范,占语料库的50.7%。知识样本来自公开标准文档、研究论文和运营商文档中的电信术语表,占21.5%。建模样本来自srsRAN项目C++代码库、电信工程教材及课程讲义,以及arXiv电信数学论文,占17.4%。故障样本遵循[17]中的合成数据生成流程,该流程将用户侧记录与工程参数表结合,推断5G RAN中下行吞吐量低于600 Mbps的根因,占剩余的10.4%。这些来源共同生成包含67,427个样本的SFT语料库,如图1所示。
#### 问题合成与提取
我们将每个源家族转化为电信推理问答对。对于基于规范的协议数据,我们解析公开的3GPP和O-RAN PDF,投影文档和工作组标签,并合成需要条款级或流程级理解的问题。对于基于实现的建模样本,我们将问题锚定在来自srsRAN[6]的抽象语法树和Doxygen符号上,然后合成层次感知的多选题(MCQ),干扰项从邻近模块、函数或协议概念中抽取。对于数学建模数据,我们使用MinerU[16]解析教材、课程讲义和arXiv论文,遮盖公式或推导目标,并生成需要恢复或应用缺失计算的问题。对于知识数据,我们将通用电信事实和术语表转化为事实性和术语性QA样本。对于表格推理,我们使用371个真实3GPP表格构建3GPP表格子语料库,并合成基于表格的干扰项。对于故障分析,我们基于[17]引入的诊断场景构建,但将其原始粗规则集扩展为将计算、阈值检查和根因分配分离的规则重放系统。
#### CoT生成与验证
最后,我们生成源匹配的推理轨迹,而非依赖单一通用CoT提示。协议和知识问题使用经自验证过滤的教师LLM解释。数学示例使用基于Python的CoT轨迹,通过符号等价性(带单位容差)重新执行和检查。故障分析示例使用确定性规则重放。教师LLM计算相关吞吐量和无线指标,记录哪些诊断规则被触发,并以结构化`[计算]/[规则]/[答案]`格式推导最终根因标签。这确保了故障分析解释与诊断规则引擎完全一致,而不仅仅是教师撰写的解释。在所有维度中,生成的轨迹进一步通过前缀续写自验证过滤——将解释作为强制前缀重播,确保标准答案必须能从续写中重新推导。生成后,所有样本经过共享归一化:多轮验证、增强、泄露过滤、难度分层和风格混合,然后归一化为标准的`{system, user, assistant}`模式,每行标注维度和源标签。每个维度配有一个二元验证器V^(a):协议和知识使用`\boxed{L}`/`ANSWER: $L$`选项匹配;建模使用带单位容差的符号等价性检查加带框字母MCQ回答;故障使用确定性规则重放。相同的验证器家族在II-B节提供RL奖励,形成一个可消融的接口,用于维度重新加权、CoT生成器替换和泄露策略分析。
### II-B 后训练:SFT与DAPO
我们分两个阶段对Qwen3.5-9B进行后训练。阶段1通过LoRA-SFT进行知识注入和推理格式引导。令D={x^(n), y^(n)}表示精选的轨迹集,π_θ表示适配器秩为r、缩放系数α=2r的LoRA适应策略。我们最小化token级负对数似然:
L_SFT(θ) = -E_{(x,y)∼D}[1/|y| Σ_{t=1}^{|y|} log π_θ(y_t | x, y_{<t})]
阶段2采用DAPO[18](GRPO的变体)进行策略优化,使用每维度二元验证器奖励R^(a)(o) = 1[V^(a)(o, y^*) = 1],其中a∈{protocol, knowledge, modeling, fault}。对于与提示x关联的 rollout 组,R(o_i)=R^(a(x))(o_i)。由于所有奖励都是二元的,许多 rollout 组携带的策略梯度信号很弱。因此,我们应用动态采样,仅保留奖励分布非退化的组:G_train = {(x, {o_i}_{i=1}^G) : 0 < 1/G Σ_{i=1}^G R(o_i) < 1}。为数值稳定性,组相对优势计算为Â_i = (R(o_i) - mean_{j=1}^G R(o_j)) / (std_{j=1}^G R(o_j) + η)。相似文章
Telco-GAIA:电信领域智能体的双语基准测试
Telco-GAIA是一个用于评估电信领域工具使用智能体的双语多模态基准测试,包含100个经过人工验证的任务,要求对异构来源进行多跳推理,并通过精确字符串匹配进行客观评分。
Claude与GPT的隐藏推理被解码,这很有趣
最近的一篇论文展示了一种从Claude和GPT等专有LLM API中检索隐藏推理轨迹的技术,这对开源模型的比较、基准测试的完整性和蒸馏工作都有影响。
MiniCPM5-1B 表明小模型竞赛尚未结束
MiniCPM5-1B 是 OpenBMB 推出的一个拥有 10 亿参数的模型,在 AIME 2025 和 τ2-Bench Telecom 上取得了令人瞩目的成绩,超越了更大的模型。它从单个检查点同时提供快速模式和推理模式,这得益于包括监督微调、强化学习和在线策略蒸馏在内的三阶段后训练过程。
RecGPT-V3 技术报告
RecGPT-V3 引入了一种有状态、混合模态的推荐系统,通过记忆中枢和潜在意图推理,将计算量减少55.8%,输出token成本降低200倍,在淘宝信息流中取得了显著收益。
PRB-RUPFormer:一种用于残差PRB预测的递归统一概率Transformer
提出PRB-RUPFormer,一种递归统一概率Transformer,用于预测蜂窝网络中残差物理资源块,在商业LTE数据上实现了高精度和不确定性量化。