PlanE: 面向基于抽取的大型语言模型的数据、微调与推理的元规划

arXiv cs.AI 论文

摘要

PlanE 提出了一种用于构建基于抽取的LLMs的元规划框架,通过数据-微调-推理规划器优化数据分解、指令微调和提示推理,以提高构建效率。

arXiv:2607.20470v1 公告类型:新 摘要:增强大型语言模型(LLMs)的任务特定能力主要需要大量的指令微调数据集。然而,如此庞大的数据量带来了可观的标注成本,并且缺乏针对特定任务定制LLMs的优化方法。为了解决上述问题,我们提出了一个用于构建基于抽取的LLMs的\textbf{规划}框架,称为\textbf{PlanE},包括数据分解、指令微调和提示推理。此外,我们引入了一个数据-微调-推理(DTI)规划器,旨在为特定数据集选择最优的基础LLM及其DTI组合,以提高构建效率。实验结果表明,我们的PlanE从两个角度是有效的:(1) 在相同基础LLM下使用不同数据集,(2) 在不同基础LLM下使用相同数据集。此外,我们还在不同优化目标下验证了所提出的DTI规划器的泛化能力。代码公开于 https://github.com/gugugu-469/PlanE。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:00

# 基于抽取的大语言模型的数据、微调与推理元规划

来源:https://arxiv.org/html/2607.20470

王嘉诚♢,张蔚燕♠11footnotemark:1,余广亚♠
♢蚂蚁集团,上海,中国
♠华东理工大学信息科学与工程学院,上海,中国
通讯作者:xueqiao\.wjc@antgroup\.com (https://arxiv.org/html/2607.20470v1/[email protected]),weiyanzhang@ecust\.edu\.cn (https://arxiv.org/html/2607.20470v1/[email protected])

###### 摘要

增强大语言模型(LLMs)的任务特定能力主要需要大量的指令微调数据集。然而,此类数据庞大的规模带来了可观的标注成本,并且在为特定任务定制LLM方面缺乏优化方法。为解决上述问题,我们提出了一个用于构建基于抽取的LLM的规划框架,称为PlanE,其中包括数据分解、指令微调和提示推理。此外,我们引入了一个数据-微调-推理(DTI)规划器,旨在为特定数据集选择最优的基础LLM及其DTI组合,以提高构建效率。实验结果表明,我们的PlanE从两个角度均有效:(1) 在相同基础LLM下,针对不同数据集;(2) 在相同数据集上,使用不同基础LLM。此外,我们还验证了所提出的DTI规划器在不同优化目标下的泛化能力。代码已在https://github.com/gugugu-469/PlanE/ 公开。

PlanE:基于抽取的大语言模型的数据、微调与推理元规划

王嘉诚♢††感谢:同等贡献。,张蔚燕♠11footmark:1††感谢:通讯作者。,余广亚♠
♢蚂蚁集团,上海,中国
♠华东理工大学信息科学与工程学院,上海,中国
通讯作者:xueqiao\.wjc@antgroup\.com (https://arxiv.org/html/2607.20470v1/[email protected]),weiyanzhang@ecust\.edu\.cn (https://arxiv.org/html/2607.20470v1/[email protected])

请参阅标题说明
图1:(a) 构建任务特定LLM的三个关键因素。(b) 对于相同的基础LLM,在不同任务数据集上最优性能不同。(c) 在相同数据集上,不同基础LLM通过不同的DTI组合达到最佳性能。

## 1 引言

LLMs在根据各种指令生成符合人类偏好的响应方面展示了强大能力。增强LLMs任务特定能力的一项关键技术是指令微调,它利用指令-响应对形式的数据使模型与人类偏好对齐。

根据LLM优化的阶段,这些工作可分为三类。首先,数据精细化采用数据增强和数据结构变换来提升LLM性能Ding等(2024 (https://arxiv.org/html/2607.20470#bib.bib44));Chang等(2024 (https://arxiv.org/html/2607.20470#bib.bib45))。然而,这些方法常受数据质量限制Li等(2024a (https://arxiv.org/html/2607.20470#bib.bib43))。其次,多任务微调同时在多个信息抽取(IE)任务上训练LLM,以提升泛化能力Abdelaziz等(2024 (https://arxiv.org/html/2607.20470#bib.bib46))。但此类方法并不能显著提升特定任务的性能,且微调成本高昂Brief等(2024 (https://arxiv.org/html/2607.20470#bib.bib47))。第三,检索增强生成将检索机制与LLM相结合,通过外部知识库(KBs)增强任务性能Wang等(2025 (https://arxiv.org/html/2607.20470#bib.bib48));Su等(2024 (https://arxiv.org/html/2607.20470#bib.bib49))。然而,该方法受限于构建专门知识库的挑战Li等(2024b (https://arxiv.org/html/2607.20470#bib.bib50))。

当前研究主要聚焦于使用LLM技术,但在为IE特定任务构建LLM方面缺乏研究。构建IE特定LLM时,需要考虑包括数据、微调和推理在内的整个过程的优化,如图1 (https://arxiv.org/html/2607.20470#S0.F1)(a)所示:1) **数据**。鉴于训练数据有限,构建高质量的指令微调数据是一项重大挑战。2) **微调**。对于不同数据结构的训练数据,确定最佳的微调策略组合以最大化LLM潜力是关键。3) **推理**。对于微调后的LLM,设计提示以充分利用其推理能力仍是另一个关键问题。此外,将这三个阶段整合并联合优化为全面解决方案也是一大难点。这是因为,如图1 (https://arxiv.org/html/2607.20470#S0.F1)(b)所示,即使使用相同的三种数据-微调-推理(DTI)组合,对于相同的基础LLM,在不同任务数据集上的最优性能也不同。类似地,如图1 (https://arxiv.org/html/2607.20470#S0.F1)(c)所示,即使在相同数据集上,尽管使用相同的三种DTI组合,不同基础LLM也能通过不同的DTI组合达到最佳性能。

在本文中,我们提出了一种新的框架,用于选择组合以构建基于抽取的LLM,称为PlanE。核心思想是为基于抽取的LLM构建过程的三个关键阶段(即数据、微调、推理)设计优化方案,并提出一种组合选择函数来确定最优的构建策略。具体来说,在数据方面,我们引入了两种数据分解:基于流水线的和双向的。这些方案将复杂任务分解为序列化原子子任务的组合。然后,在微调方面,我们采用指令微调。基于子任务的分解数据结构,我们采用监督微调(SFT),以及SFT与强化学习结合(SFT+RL)。最后,在推理方面,我们采用提示推理,包括三种推理策略:直接推理、交集推理和并集推理。此外,我们设计了一个DTI规划器,通过对经验数据进行元学习,预测给定任务数据集和基础LLM的最优DTI组合,从而优化基于抽取的LLM构建。

本文的贡献如下:

- • 我们设计了一种新颖的DTI规划器,为基于抽取的LLM选择最优的DTI组合。此外,该规划器还能执行多目标优化,在构建基于抽取的LLM的性能和效率之间取得平衡。
- • 我们提出了PlanE框架,通过三个关键模块增强高性能LLM的构建。从整体优化的角度,它根据指定的基础LLM和数据集确定合适的DTI组合。
- • 我们在三个任务数据集上进行了大量实验。结果从两个角度证明了我们方法的有效性:在相同基础LLM下跨不同任务数据集,以及在相同任务数据集上使用不同基础LLM。此外,我们还验证了所提出的DTI规划器在不同优化目标下的泛化能力。

请参阅标题说明
图2:PlanE框架。
## 2 相关工作

近期在任务特定LLM元规划方面的工作可大致分为几类:1) 策略空间设计,2) 元策略学习,3) 优化目标。

第一类是策略空间设计,它定义了元规划器可用的高级策略或元动作集合。例如,DeepSpeed-InferenceAminabadi等(2022 (https://arxiv.org/html/2607.20470#bib.bib61))通过内核选择和并行配置定义其策略空间。DyPlanParekh等(2025 (https://arxiv.org/html/2607.20470#bib.bib63))通过组合推理路径(如思维链、检索增强生成)构建动态策略空间。在去中心化设置中,MetaInfDu等(2025 (https://arxiv.org/html/2607.20470#bib.bib64))利用语义嵌入和历史元数据预测加速策略,实现无需在线分析的零样本泛化。

第二类,元策略学习,指在策略空间内构建或学习从上下文到动作的最优映射。MetaGPTHong等(2024 (https://arxiv.org/html/2607.20470#bib.bib65))依赖手工制作的工作流,而PromptAgentWang等(2024 (https://arxiv.org/html/2607.20470#bib.bib67))采用强化学习发现动态推理和提示策略,有效地学习了元策略。类似地,数据层面的规划方法如DataRaterCalian等(2025 (https://arxiv.org/html/2607.20470#bib.bib68))和GradMatchKillamsetty等(2021 (https://arxiv.org/html/2607.20470#bib.bib69))用于样本选择,以及MoE-ScalingTian等(2025 (https://arxiv.org/html/2607.20470#bib.bib70))用于专家配置,可以被视为数据和架构管理的元策略学习的专门形式。

第三类,优化目标,定义了指导策略空间内策略选择和评估的标准或指标,如延迟、准确率、成本或效率。DeepSpeed-Inference平衡延迟和准确率,而AdaCoTLou等(2025 (https://arxiv.org/html/2607.20470#bib.bib66))使用帕累托搜索来权衡成本-性能。Meta-R1Dong等(2025 (https://arxiv.org/html/2607.20470#bib.bib71))引入了根尺度效率用于跨尺度效率归一化,ChinchillaHoffmann等(2022 (https://arxiv.org/html/2607.20470#bib.bib72))提供了计算最优缩放定律,已被Llama 2Touvron等(2023 (https://arxiv.org/html/2607.20470#bib.bib73))采用。

现有策略空间通常局限于孤立方面,缺乏同时涵盖数据、训练和推理的统一表示。元策略学习仍然碎片化,一些方法依赖手工规则,另一些仅优化局部决策。优化目标要么狭义解耦,要么基于理想化的缩放定律,忽略了实际的多目标权衡。为解决这些问题,本文引入了一个数据驱动的规划器,它将整个配置空间统一为单一策略表示,通过经验性能建模学习集成元策略,并直接联合优化性能-效率目标。

## 3 概述

在本节中,我们首先正式定义三个IE任务。然后,概述我们提出的PlanE。

### 3.1 任务定义

定义1:关系抽取任务(RE)
给定输入文本C=[c1,c2,...,cn]和一组预定义关系R={r1,r2,...,rl},其中n和l分别表示C中的标记数和R中的关系数,关系抽取任务的目标是获得一组三元组T={ (hi, ri, ti) }_{i=1}^{m},其中hi, ti表示由ri连接的头实体和尾实体,m表示抽取的三元组总数。

定义2:事件抽取任务(EE)
给定文本Ce=[c1,c2,...,c_ne]和预定义事件类型E={e1,e2,...,e_le},事件抽取任务旨在从Ce中检测提及的事件触发词tr和论元A={a1,a2,...,a_me},以及事件类型e∈E(例如,EAT, LOCATION等)。

定义3:方面级情感分析任务(ABSA)
给定文本Ca=[c1,c2,...,c_na]、一组预定义情感极性S={s1,s2,...,s_la}(例如,{POSITIVE, NEGATIVE, NEUTRAL}),其中na和la分别是Ca中的标记数和S中的情感极性数,ABSA任务旨在从Ca中抽取一组方面-情感三元组Y={ (at_j, o_j, s_j) }_{j=1}^{k}。k是方面-情感三元组的数量,at_i, o_i表示Ca中的方面词和观点词。

### 3.2 框架

如图2 (https://arxiv.org/html/2607.20470#S1.F2)所示,我们的解决方案是通过两部分构建基于抽取的LLM(例如,RE-LLM)。1) **数据、微调与推理规划**。具体来说,在数据方面,给定训练集,我们引入两种数据分解:基于流水线的和双向的。然后,在微调方面,基于子任务的分解数据结构,我们采用两种指令微调方式:SFT和SFT+RL。最后,在推理方面,基于微调后的LLM,我们采用三种提示推理策略:直接推理、交集推理和并集推理。2) **规划器构建**。为了实现最优DTI组合的自动预测,我们设计了一个DTI规划器。该规划器通过对经验数据进行元学习,预测给定数据集和基础LLM的最优DTI组合,从而优化基于抽取的LLM构建。

## 4 PlanE

本节详细阐述PlanE,包括:(1) 数据规划(数据分解)、微调规划(指令微调)和推理规划(提示推理),(2) 规划器构建,以及(3) 规划器使用。

### 4.1 数据、微调与推理规划

**数据分解**。本节提出一种任务分解方法,旨在通过数据增强提升语言模型在复杂任务上的性能。通过将任务分解为子任务,我们提高了LLM每一步的精度,并减少了错误传播。我们提出两种分解策略:基于流水线的和双向的。在基于流水线的分解中,任务被分为顺序子任务,一个子任务的输出作为下一个子任务的输入。例如,在RE任务中,可以通过两种方式实现:首先,执行实体识别(ER)抽取头尾实体对,然后进行关系分类(RC)生成三元组;其次,先执行RC确定关系,然后执行ER抽取相应的头尾实体对并输出三元组。在双向分解中,从两个方向处理任务以提高精度。例如,在RE中,先抽取头实体,生成关系,再抽取尾实体;或者从尾实体开始,依此类推。

**指令微调**。为使模型与多样化的任务结构和子任务目标对齐,我们采用两种微调策略:1) SFT。所有数据被格式化为结构化的输入-输出指令对,并对单个模型进行微调以处理RE任务及其子任务。2) SFT + RL。这是一种两阶段指令微调策略。首先,使用大部分数据通过SFT训练模型,所有样本被格式化为结构化输入-输出指令对,以获得通用任务解决能力。然后,在剩余子集上应用RL,通过基于反馈的奖励机制进一步优化模型性能。具体而言,我们采用三种基于RL的优化方法,即

相似文章

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。

属性引导的LLM规划程序综合

arXiv cs.AI

本文提出属性引导的LLM程序综合方法,利用反例引导归纳综合(CEGIS)在候选程序违反形式化属性时提供具体反馈,从而减少生成次数和评估成本。应用于PDDL规划领域以综合直接启发式函数,该方法优于先前方法,生成的程序数量减少七倍,且无需搜索即可解决更多任务。

PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统

arXiv cs.AI

本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。