通过强化学习改进LLM生成的流程模型质量:奖励函数设计的作用
摘要
本文系统研究了用于强化学习的奖励函数设计,以提升LLM生成的BPMN流程模型质量,发现等权重奖励优于目标加权奖励,且设计选择与模型架构以非平凡的方式相互影响。
arXiv:2607.06175v1 公告类型:新
摘要:大语言模型(LLMs)能够根据自然语言描述生成BPMN流程模型,但监督微调(SFT)将其输出质量限制在训练数据中的模式。强化学习(RL)可以通过外部质量度量来优化超越这一上限,但多维度质量下奖励函数应如何设计仍未得到探索。我们系统研究了基于RL的流程模型生成的奖励函数设计,使用组序列策略优化(Group Sequence Policy Optimization)训练了两个LLM系列(Llama 3.1 8B, Qwen 2.5 14B),共48种配置,奖励来自一个包含38个指标的自动评估框架,涵盖语法、语用和语义质量。我们得出了三个发现。首先,RL在保持语义忠实度的同时显著提升了语用和语法质量,将输出变异性降低了六倍以上。其次,等权重奖励始终优于目标加权奖励:强调特定维度不仅未能改善该维度,反而可能导致模型陷入低质量模式。第三,设计选择与模型架构以非平凡的方式相互影响:无效性惩罚对一个模型至关重要,但对另一个模型无关紧要;SFT初始化对一种架构不可或缺,但对另一种架构适得其反。这些结果表明,奖励组合是优化结果的主要决定因素,其影响与是否应用RL本身一样大。这些发现适用于任何通过多个自动化维度评估质量的生成任务。我们已在https://github.com/chlauer99/RL_for_process_modeling发布实现和实验代码。
查看缓存全文
缓存时间: 2026/07/08 04:42
# 通过强化学习改进LLM生成的流程模型质量:奖励函数设计的作用 来源:https://arxiv.org/html/2607.06175 \[orcid=0000-0002-9173-4215\]\cormark\[1\]\credit概念化、方法论、软件、撰写初稿、撰写审阅与编辑 \credit 概念化、数据整理、软件、撰写初稿、撰写审阅与编辑 \[orcid=0000-0001-7899-1017\]\credit监督、方法论、形式分析、验证、撰写初稿、撰写审阅与编辑 1\]organization=德国人工智能研究中心 (DFKI), addressline=Campus D3 2, city=萨尔布吕肯, postcode=66123, state=萨尔州, country=德国 2\]organization=萨尔大学, addressline=Campus D3 2, city=萨尔布吕肯, postcode=66123, state=萨尔州, country=德国 \cortext \[1\]通讯作者 Chantale Lauer [email protected] Nijat Mehdiyev [email protected] ###### 摘要 大语言模型(LLMs)可以从自然语言描述中生成BPMN流程模型,然而监督微调(SFT)将它们的输出质量限制在训练数据中存在的模式范围内。强化学习(RL)可以利用外部质量指标来优化超越这个上限,但当质量是多维时,奖励函数应如何设计仍未被探索。我们系统调查了基于RL的流程模型生成的奖励函数设计,使用组序列策略优化(Group Sequence Policy Optimization)在与来自自动化评估框架的奖励(包含38个指标,涵盖语法、语用和语义质量)下训练了两种LLM家族(Llama 3.1 8B, Qwen 2.5 14B),共48种配置。三个发现出现:第一,RL在保持语义保真度的同时显著提高了语用和语法质量,将输出变异性减少了六倍以上;第二,等权重奖励始终优于针对性权重:强调特定维度不仅未能改善该维度,还可能导致模型坍塌到低质量模式;第三,设计选择与模型架构以非平凡方式交互:无效性惩罚对一个模型至关重要但对另一个无关紧要,SFT初始化对一种架构不可或缺但对另一种适得其反。这些结果表明,奖励组成是优化结果的主要决定因素,其影响与应用RL本身一样大。这些发现适用于任何质量沿多个自动维度评估的结构化生成任务。我们在[https://github.com/chlauer99/RL_for_process_modeling](https://github.com/chlauer99/RL_for_process_modeling) 发布我们的实现和实验代码。 ###### 关键词:业务流程建模\sep大语言模型\sep监督微调\sep强化学习 ## 1 引言 创建业务流程模型与符号(BPMN)模型是一项复杂任务,既需要领域知识又需要熟悉建模规范。随着组织越来越多地寻求记录、分析和自动化其工作流程,对流程模型的需求已超出训练有素的建模人员的供给,形成瓶颈,限制了业务流程管理计划的可扩展性\[kampik2025large\]。大语言模型(LLMs)为解决这一瓶颈提供了一条有希望的路径:直接从自然语言描述生成流程模型,从而降低专业壁垒并加速建模生命周期\[klievtsova2023conversational\]。近期工作表明,LLM确实可以从文本生成类似BPMN的结构,交互式系统支持迭代细化\[kourani2024promoai, lauer\_conversational\_modeling\],紧凑的中间表示提高了生成鲁棒性\[brissard2025representation, kopke2025efficient\]。系统性基准测试进一步表明,开源LLM在BPMN生成任务上达到了具有竞争力的语法和语用质量,尽管语义保真度和输出有效性仍然是重大挑战\[lauer2026bef4llm\]。使用LoRA\[hu2022lora\]等参数高效方法的监督微调(SFT)已被证明能改善结构正确性和有效性,使较小模型胜过较大的未调优基线模型。然而,SFT本质上受限于它所模仿的训练数据的质量和多样性:它可以教会模型重现训练语料中存在的模式,但无法驱动模型超越这个上限,产生比演示“更好”的输出。 强化学习(RL)提供了一种根本不同的训练信号。模型不是模仿参考输出,而是根据评估其生成输出的外部质量指标进行优化。近期出现的具有可验证奖励的强化学习(RLVR)\[lambert2024tulu3, guo2025deepseekr1\]表明,当自动化、确定性的评估可用时(如在数学推理或代码生成中),RL可以在不需要人类偏好数据的情况下产生超过SFT基线的实质性改进。流程模型生成非常适合这一范式:BEF4LLM评估框架\[lauer2026bef4llm\]提供了跨三个既建质量维度(语法、语用和语义质量)的38个自动化指标,可直接用作奖励信号,从而为流程建模实现RLVR。然而,奖励函数本身的设计,特别是如何将这些多维质量指标组合成训练信号,几乎没有受到系统的关注。现有的关于流程建模中RL的工作\[berti2025specializing\]证明了RL可以提高生成质量,但使用了单一的奖励公式,没有研究奖励的组成如何影响优化结果。更广泛地说,大多数RLVR应用使用单维奖励(数学正确/错误,代码测试通过/失败),而流程模型质量本质上是多维的:语法一致性、语用可理解性和语义保真性代表了不同且可能相互竞争的优化目标。如何平衡这些目标,通过奖励的维度加权能否将优化导向期望的质量轮廓,以及无效性惩罚等设计选择如何与模型架构交互,这些都是尚未解答的问题。 本文通过系统性的实证研究来解决奖励函数设计在基于RL的流程模型生成中的问题。我们采用组序列策略优化(GSPO)\[zheng2025gspo\],一种自然地与整体质量评估对齐的序列级RL方法,并在48个实验配置下训练了两个开源LLM家族(Llama 3.1 8B和Qwen 2.5 14B),涵盖六种奖励函数、两种基模型初始化策略和两种解码约束。奖励函数沿着两个主要设计轴变化:维度加权(等权重 vs. 针对性强调)和无效性惩罚(负惩罚 vs. 零)。此外,我们包含两个数学上等价的等权重实现\(R_{avg}\)和\(R_1\),以检查实现路径差异是否产生可测量的影响。所有配置均使用BEF4LLM框架进行评估,并通过配对排列检验\[good2005permutation\](Bonferroni校正)进行比较。 本研究由三个研究问题引导。RQ1询问使用领域基础奖励的GSPO是否提高了超出SFT的流程模型质量。RQ2调查奖励函数组成,特别是维度加权和无效性惩罚,如何影响质量维度之间的平衡。RQ3考察基模型初始化策略的选择(SFT初始化的 vs. 未训练的,即未适应BPM的指令调优基模型)如何影响RL优化结果。 结果产生了几项超出BPMN领域的发现。第一,GSPO在两种模型家族上都显著提高了语用和语法质量,同时大体上保持了语义质量,对Llama仅有小的正面影响,对Qwen则无显著影响。最显著的效果是输出变异性的大幅降低:RL训练的模型比仅SFT的基线产生更一致的输出。第二,最反直觉的是,等权重奖励优于所有针对性加权方案。在奖励中强调特定质量维度不仅未能改善该维度,反而可能导致模型坍塌到狭窄的低质量模式。第三,无效性惩罚的作用远远超出仅仅劝阻无效输出。对于Qwen,它充当隐式的多样性正则化器,降低模板收敛的风险,而对Llama则没有可测量的影响。第四,SFT初始化的必要性依赖于架构:在我们的训练配置下对Llama不可或缺,对Qwen则大体冗余,并在RL后与Qwen的较低语义质量相关。这些发现表明,针对多维结构化生成的奖励函数设计是一个非平凡的工程挑战,其中看似微小的选择产生的影响与应用RL本身一样大。 本文的贡献如下: 1. 一个训练框架,用于在SFT之后或直接应用于未适应BPM的指令调优基模型时应用GSPO,使用来自BEF4LLM质量框架的基于领域、多维的奖励信号,用于基于LLM的BPMN流程模型生成。 2. 对结构化生成中奖励函数设计的系统性实证调查,涵盖维度加权、无效性惩罚,以及跨两种LLM架构和两种初始化策略的等价奖励实现路径的探索性比较,包含48个实验配置,在105个流程描述上进行评估。 3. 对奖励设计、模型架构和初始化策略之间的交互效应进行分析,揭示这些因素并非独立可调,而是以非平凡方式交互,需要实证评估而非原则性默认值。 4. 将RL应用于多维结构化生成任务的实用指南,包括在我们的实验中等权重是最鲁棒的默认值,惩罚制度应与基模型的有效性行为匹配,SFT初始化应参考基模型的任务相关先验能力。 本文的其余结构如下。第2.2节回顾了关于BPM中LLM、LLM的RL、质量评估框架以及结构化生成中RL的相关工作。第3节描述了方法论,包括训练流水线、质量框架和奖励函数设计。第4节详细介绍了实验设置。第5节按研究问题呈现结果。第6节讨论发现、与相关工作比较,并指出局限性和未来工作。第7节总结论文。 ## 2 相关工作 ### 2.1 业务流程建模中的LLM 大语言模型在业务流程管理(BPM)中的应用已从概念验证演示迅速发展到系统评估和专门训练流水线。早期工作表明,LLM可以将自然语言描述翻译为正式过程表示\[klievtsova2023conversational\],而ProMoAI\[kourani2024promoai\]等交互式系统展示了迭代细化能力。最近的一篇文献综述强调了从非生成式提取流水线到端到端生成式方法的方法论转变,将领域适配(通过微调)和中间表示设计确定为两个最活跃的前沿\[kampik2025large\]。 系统性基准测试揭示了当前LLM的潜力和局限性。Lauer等人\[lauer2026bef4llm\]引入了BEF4LLM,一个包含38个指标的框架,涵盖语法、语用和语义质量维度,并对17个开源LLM在BPMN生成上进行了基准测试——发现LLM实现了有竞争力的结构质量,但在语义保真度上落后于人类专家。Horner等人\[horner2026bpmn\]独立确认了这些模式,同时提出了一套自动化的BPMN 2.0生成流水线及质量评估。\[lauer2026humancentered\]进行了一项以人为中心的研究,同样将流程模型的语义质量确定为影响感知可用性和信任的关键因素,而低语义质量对生成的流程模型的感知可用性和信任产生了负面影响。Celikmasat等人\[celikmasat2025bpmn\]证明,通过监督微调(SFT)在精心策划的流程模型数据集上,可以进一步改进指令调优的开源LLM。 输出表示的选择已成为关键因素。基于JSON的紧凑中间语言相比XML大幅减少了令牌数量,同时保留了BPMN语义,实现了高效的微调并提高了生成鲁棒性\[brissard2025representation, kopke2025efficient\]。本研究在此基础上构建——使用基于JSON的紧凑流程表示作为输出格式,并以BEF4LLM作为评估框架——但将焦点从表示和基准测试转移到“训练方法论”,特别是针对多维质量优化的RL奖励函数设计。 ### 2.2 大语言模型的强化学习 强化学习(RL)已成为LLM后训练对齐的核心。标准的RLHF流水线\[ouyang2022training\]使用学习的奖励模型和近端策略优化(PPO)\[schulman2017ppo\]微调预训练模型,并通过KL散度惩罚进行约束。虽然对偏好对齐有效,但基于PPO的方法存在不稳定、计算开销高以及对奖励缩放敏感的问题——这些问题在长水平结构化生成任务中更为突出。 直接偏好优化(DPO)\[rafailov2023dpo\]通过将RLHF目标重新参数化为直接在偏好对上进行操作,绕过了显式奖励模型。虽然DPO简化了训练,但它需要成对偏好数据,并且不能自然地适应我们设置中可用的那种可验证的、基于指标的奖励信号。Kahneman-Tversky优化(KTO)\[ethayarajh2024kto\]进一步将数据需求放松到非成对信号,但共享相同的基本限制。 “具有可验证奖励的强化学习”(RLVR)\[lambert2024tulu3\]的出现代表了与我们工作特别相关的范式转变。RLVR不是从人类偏好中学习奖励模型,而是利用自动化、确定性的评估(如数学正确性验证或代码测试用例执行)作为奖励信号。DeepSeek-R1\[guo2025deepseekr1\]证明,使用组相对策略优化(GRPO)\[shao2024deepseekmath\]的RLVR可以在没有任何监督演示数据的情况下解锁复杂的推理能力,引发了对此方法的广泛兴趣。GRPO为每个提示采样多个候选输出,在每个组内归一化奖励,并更
相似文章
奖励驱动的大语言模型代理工作流:融合POMDP路由与自我修正的自主决策
本文提出了一种奖励驱动的大语言模型代理工作流,融合了POMDP路由与自我修正奖励模型,在ALFWorld和WebShop等基准测试中任务成功率提升了24.5%。
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。
@svlevine: 我们可以学习一个模型,为机器人强化学习提供塑造的“过程奖励”,它会随着策略的改进而自动演变…
这项工作提出了一个模型,该模型学习塑造的“过程奖励”用于机器人强化学习,该奖励会随着策略的改进而自动演变,从而在基准测试和实际环境中提升性能。
无监督过程奖励模型
本文提出无监督过程奖励模型(uPRM),通过利用LLM的下一个令牌概率识别错误推理步骤,从而消除人工标注需求,在准确率上相比LLM-as-a-Judge提升高达15%,并且作为验证器和奖励信号时表现与有监督PRM相当。
最弱一环说明一切:通过可学习信用分配的结果监督过程奖励建模
本文提出通过可学习信用分配的结果监督过程奖励建模(LCA),一个在最弱一环原则下联合学习信用分配和奖励建模的框架,将其形式化为一个使用Softmax加权和池化的多实例学习问题。实验表明,它在多个任务上优于现有的结果监督过程奖励模型(PRMs)。