Strategy-Induct:任务级策略归纳用于指令生成

arXiv cs.CL 论文

摘要

提出Strategy-Induct框架,该框架仅从示例问题中归纳任务级指令,无需标注答案,首先为每个问题生成显式推理策略,然后利用问题-策略对来归纳指令。该方法在仅包含问题的场景下,跨多个任务和模型规模均优于现有方法。

arXiv:2605.20924v1 公告类型:新 摘要:设计有效的任务级提示对于提升大型语言模型(LLMs)的性能至关重要。虽然先前关于指令归纳的工作表明,LLMs能够通过有限的示例推断出更好的指令,但现有方法通常依赖于输入-输出对,而获取标注答案可能困难或成本高昂。为解决这一限制,我们提出了Strategy-Induct,这是一个仅需少量示例问题而无需标注答案即可推导任务级指令的框架。我们的方法首先提示模型为每个问题生成显式的推理策略,形成(策略,问题)对。然后利用这些对来归纳指导推理的任务指令。跨多个任务和模型规模的实验表明,Strategy-Induct在仅包含问题的场景下优于最先进的方法。此外,我们观察到,在任务指令生成和推理过程中联合使用LLMs和大推理模型可能带来进一步的性能提升。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:36

# 任务级策略归纳用于指令生成 来源:https://arxiv.org/html/2605.20924 Po\-Chun Chen1Hen\-Hsen Huang2Hsin\-Hsi Chen1,3 1国立台湾大学资讯工程学系,台湾 2中央研究院资讯科学研究所,台湾 3国立台湾大学人工智能研究中心 \(AINTU\),台湾 pcchen@nlg\.csie\.ntu\.edu\.tw, hhhuang@iis\.sinica\.edu\.tw, hhchen@ntu\.edu\.tw ###### 摘要 设计有效的任务级提示对于提升大型语言模型 \(LLMs\) 的性能至关重要。虽然先前的指令归纳研究表明 LLMs 可以通过有限的示例推断出更好的指令,但现有方法通常依赖输入-输出对,而获取标注答案可能困难或成本高昂。为克服这一限制,我们提出 **Strategy-Induct** 框架,该框架仅凭一小部分示例问题即可推导出任务级指令,无需标注答案。我们的方法首先提示模型为每个问题生成显式的推理策略,形成 (策略, 问题) 对。然后利用这些对归纳出一条任务指令以指导推理。跨多个任务和模型规模的实验表明,**Strategy-Induct** 在纯问题设置下优于当前最先进方法。此外,我们观察到在任务指令生成和推理阶段联合使用 LLMs 和大型推理模型可能会进一步提升性能。 **Strategy-Induct:用于指令生成的任务级策略归纳** Po\-Chun Chen1Hen\-Hsen Huang2Hsin\-Hsi Chen1,3 1国立台湾大学资讯工程学系,台湾 2中央研究院资讯科学研究所,台湾 3国立台湾大学人工智能研究中心 \(AINTU\),台湾 pcchen@nlg\.csie\.ntu\.edu\.tw, hhhuang@iis\.sinica\.edu\.tw, hhchen@ntu\.edu\.tw 参见图说明图1:我们提出的 **Strategy-Induct** 框架,用于基于策略的指令归纳。该框架包含三个阶段:(1) 策略阶段,LLM 为给定输入 \(x_i\) 生成策略 \(s_i\)。(2) INDUCT 阶段,将问题-策略对 \((s_i, x_i)\) 与元提示及短短语结合,生成归纳提示 \(P_{\text{Strategy-Induct}}\)。(3) 推理阶段,使用 \(P_{\text{Strategy-Induct}}\) 指导 LLM 解决同一任务中的新问题 \(x^*\)。 ## 1 引言 大型语言模型 \(LLMs\) 在自然语言处理领域取得了显著进展,展现出强大的理解、生成和推理能力Brown et al. (2020 (https://arxiv.org/html/2605.20924#bib.bib2)); Wei et al. (2022a (https://arxiv.org/html/2605.20924#bib.bib36)); Chen et al. (2023 (https://arxiv.org/html/2605.20924#bib.bib8)); Wei et al. (2023 (https://arxiv.org/html/2605.20924#bib.bib38)); OpenAI (2023 (https://arxiv.org/html/2605.20924#bib.bib26))。提供高质量的任务指令对于让 LLMs 有效执行任务至关重要,因为设计良好的指令可以显著提升准确性和一致性。然而,设计高质量的任务指令颇具挑战性,通常需要领域知识和大量人工努力。Honovich et al. (2023 (https://arxiv.org/html/2605.20924#bib.bib16)) 表明 LLMs 可以从输入-输出对中归纳出任务指令,这一过程称为**指令归纳**。基于这一概念,后续研究探索了自动任务指令生成Zhou et al. (2022 (https://arxiv.org/html/2605.20924#bib.bib46)); Chen et al. (2024a (https://arxiv.org/html/2605.20924#bib.bib3)); Hsieh et al. (2024 (https://arxiv.org/html/2605.20924#bib.bib17))。这些方法虽然有效,但往往依赖大量外部资源或初始指令提示,对于数据或提示编写能力有限的用户来说不够实用Desmond and Brachman (2024 (https://arxiv.org/html/2605.20924#bib.bib10))。此外,它们优化后的指令通常特定于模型,限制了跨架构的泛化能力。为克服这些限制,近期研究探索了低成本指令归纳方法,仅需少量示例Chen et al. (2024b (https://arxiv.org/html/2605.20924#bib.bib7)); Zhou et al. (2024 (https://arxiv.org/html/2605.20924#bib.bib45)); Aswani et al. (2024 (https://arxiv.org/html/2605.20924#bib.bib1)),使 LLMs 能够归纳出有效的任务指令以提升推理性能。虽然 Chen et al. (2024b (https://arxiv.org/html/2605.20924#bib.bib7)) 证明 LLMs 可以利用有限示例生成更好的指令甚至具备跨模型适应性,但其方法仍然严重依赖输入-输出对。在实际应用中,这种依赖可能不切实际,因为获取标注答案往往困难或成本高昂。为解决这些挑战,我们提出 **Strategy-Induct** 框架,该框架仅从输入问题生成任务指令,无需标注答案。它不依赖输入-输出对,而是为每个示例问题创建策略,并从这些策略-问题对中归纳出一条任务级指令。如前所述,普通用户通常缺乏与 LLMs 有效沟通所需的提示编写技巧,难以构建完整规范的指令。为此,我们采用 Chen et al. (2024b (https://arxiv.org/html/2605.20924#bib.bib7)) 提出的短短语提示概念,通过简短的任务描述来传达任务意图。短短语可以在需要时与最小用户查询一起使用,如果问题本身已经自说明,也可以省略。我们在实验中使用的具体短短语列于附录 D (https://arxiv.org/html/2605.20924#A4) 中。 **Strategy-Induct** 具有多项优势。首先,它能够在纯问题设置下进行指令归纳,解决了缺少标注输出的关键挑战。其次,与提示优化方法不同,**Strategy-Induct** 生成的指令可以跨模型泛化,无需任务特定的微调。我们在纯问题场景下评估 **Strategy-Induct**,每个任务提供一组示例问题(无答案)。我们的实验涵盖多个数据集,包括 BBH-Induct、Evals-Induct 和移位密码任务。结果表明 **Strategy-Induct** 超越了现有最先进方法。此外,我们分析了它在不同 LLM 系列(如 Llama、Mistral、GPT、Gemini)、模型规模以及模型类型(包括 LLMs 和大型推理模型 LRMs,如 GPT o3 mini)上的有效性,展示了其可扩展性和鲁棒性。 ## 2 Strategy-Induct 框架 现有的指令归纳方法如 INDUCT-LEARNChen et al. (2024b (https://arxiv.org/html/2605.20924#bib.bib7)) 需要标注的输入-输出对来归纳任务指令。然而,在许多实际场景中,获取正确答案可能成本高昂或不可行。**Strategy-Induct** 通过纯问题设置消除了这一需求。其关键使能因素是**策略**阶段,该阶段为每个问题生成推理策略,为后续的归纳步骤提供本应由标注输出提供的结构化信号。本节中,我们正式描述 **Strategy-Induct** 框架,该框架从输入问题中归纳任务级指令而无需标注答案。它包含三个阶段:策略、归纳和推理。以下小节定义每个阶段(参见图1 (https://arxiv.org/html/2605.20924#S0.F1) 概览)。 ### 2.1 策略阶段 此阶段的目标是为每个输入问题 \(x_i\) 生成一个推理策略 \(s_i\)。给定来自**同一任务**的 \(N\) 个输入问题的集合: \[ \mathcal{X} = \{x_1, x_2, \dots, x_N\} \] (1) 每个 \(x_i\) 是一个任务特定的问题。LLM 被提示包含元提示 \(P_{\text{S}}\)、问题 \(x_i\) 以及可选的短短语 \(d\)(任务简短描述),以产生相应的推理策略: \[ s_i = \text{LLM}(P_{\text{S}}, d, x_i) \] (2) 对每个 \(x_i \in \mathcal{X}\) 重复此过程,得到一组策略-问题对: \[ \mathcal{S} = \{(s_1, x_1), (s_2, x_2), \dots, (s_N, x_N)\} \] (3) 下一阶段将 \(\mathcal{S}\) 作为输入,归纳出一条任务级指令提示。 ### 2.2 归纳阶段 在此阶段,我们使用收集到的策略-问题对构建归纳提示 \(P_{\text{Strategy-Induct}}\)。具体地,LLM 被提示包含元提示 \(P_{\text{I}}\)、短短语 \(d\) 和集合 \(\mathcal{S}\),以归纳出一条任务级指令。 \[ P_{\textsc{Strategy-Induct}} = \text{LLM}(P_{\text{I}}, d, \mathcal{S}) \] (4) 得到的 \(P_{\text{Strategy-Induct}}\) 是一个可重用的任务级提示,适用于同一任务中的其他问题。 ### 2.3 推理阶段 在推理时,归纳提示 \(P_{\textsc{Strategy-Induct}}\) 用于解决同一任务中的新问题。给定一个新问题 \(x^*\),LLM 生成回答: \[ y^* = \text{LLM}(P_{\textsc{Strategy-Induct}}, x^*) \] (5) 其中 \(y^*\) 是模型的回答。因此,\(P_{\textsc{Strategy-Induct}}\) 可在同一任务的问题间重复使用。 ## 3 实验 ### 3.1 模型 我们使用 18 个模型进行实验,涵盖四个 LLM 系列和两个 LRM,包括开源和闭源模型。模型版本和配置的更多细节见附录 B (https://arxiv.org/html/2605.20924#A2)。 表 1:不同模型在零样本设置下于 BBH-Induct、Evals-Induct 和移位密码上的准确率(%)。最高总体准确率以**粗体**标出。“Induct”指 INDUCT 基线。 ### 3.2 数据集 我们采用先前最先进指令归纳方法Chen et al. (2024b (https://arxiv.org/html/2605.20924#bib.bib7)) 使用的数据集,以确保与现有方法的可比性。 ##### BBH-Induct 该数据集改编自 BIG-Bench Hard (BBH) 基准Suzgun et al. (2022 (https://arxiv.org/html/2605.20924#bib.bib33)),这是一套当前 LLMs 难以达到人类平均表现水平的任务套件。它包含 23 个任务,共 5,161 个实例,涵盖逻辑推理、空间推理和语言理解等多种推理挑战。 ##### Evals-Induct 该数据集源自 OpenAI Evals 项目,包含 24 个超出最先进模型能力范围的高难度任务。每个任务包含约 91 到 378 个示例,共 3,683 个实例。 ##### 移位密码任务 我们还加入了移位密码任务Prabhakar et al. (2024 (https://arxiv.org/html/2605.20924#bib.bib30)),以评估我们的方法在符号推理任务上的有效性。该任务需要解码使用移位密码加密的文本,其中每个字母被替换为字母表中固定位置之前的另一个字母。数据集包括移位值从 \(k=1\) 到 \(25\) 的情况,要求模型泛化到不同的旋转值。每个示例是一个使用移位密码编码的七字母单词。遵循Prabhakar et al. (2024 (https://arxiv.org/html/2605.20924#bib.bib30)),我们使用最高概率箱(Bin 1)中的单词,这些单词按 GPT-2 对数概率排序,可能包含在预训练语料中频繁出现但并非有效英语单词的非标准形式。例如,一个 \(shift\_level=3\)(即 ROT-3)的案例要求将“fkrrvhg”解码回“choosed”,通过将每个字母向后移动 3 个位置:f→c, k→h, r→o,依此类推。所有数据集的更多细节见附录表 8 (https://arxiv.org/html/2605.20924#A7.T8) 到 10 (https://arxiv.org/html/2605.20924#A7.T10)。 ### 3.3 基线方法 ##### ZCoT 我们应用零样本思维链Kojima et al. (2022 (https://arxiv.org/html/2605.20924#bib.bib18)),使用短短语指令,即模型仅接收一个短短语作为推理指导。 ##### SCoT 自动策略思维链由Wang et al. (2024 (https://arxiv.org/html/2605.20924#bib.bib35)) 提出,是一种最先进的思维链 (CoT) 基线,它提示模型先识别有效的解题策略,再进行逐步推理。在我们的设置中,仅提供短短语指令作为任务描述。 ##### INDUCT Chen et al. (2024b (https://arxiv.org/html/2605.20924#bib.bib7)) 的指令归纳阶段作为最先进的指令归纳基线,它利用 LLMs 从给定示例中推断任务指令。在我们的设置中,我们向模型提供短短语和问题(无答案)以归纳任务指令。 ZCoT 和 SCoT 是**实例级**方法,仅使用短短语作为任务描述独立解决每个问题。INDUCT 和我们的 **Strategy-Induct** 是**任务级**方法,在推理前额外利用一小部分示例问题来归纳可重用的任务指令。在推理时,所有方法接收相同的输入:一条指令和一个新问题。区别在于实例级方法直接使用短短语作为指令,而任务级方法将其替换为从示例问题中归纳出的指令。 ### 3.4 其他细节 所有实验遵循 BBH-Induct 和 Evals-Induct 的设置,每个任务或子任务包含一个短短语作为任务描述。每个数据集和子任务的具体短语列于附录表 8 (https://arxiv.org/html/2605.20924#A7.T8)–10 (https://arxiv.org/html/2605.20924#A7.T10)。 ##### N 设置 我们设置 \(N=3\),因此 **Strategy-Induct** 为三个问题各生成一个策略,并从这些策略-问题对中归纳指令。 ##### 实验配置 我们使用了五个 LLM 提供商的 API 服务:OpenAI、Google、Mistral AI、SambaNova 和 Together AI。模型详情见附录 B (https://arxiv.org/html/2605.20924#A2)。出于成本考虑,我们采用Chen et al. (2024b (https://arxiv.org/html/2605.20924#bib.bib7)) 的采样策略,每个任务随机采样 25 个示例,并将温度设为 0 以获取确定性输出。 参见图说明图 2:BBH-Induct 中 23 个任务在 18 个模型上的准确率差异热力图。准确率差值为 **Strategy-Induct** 与基线方法 ZCoT 之间的差值(蓝色/红色表示我们的方法获胜/失败)。 参见图说明图 3:各 LLM 系列中最大模型在移位密码 25 个子任务上的直接比较。准确率差值表示 **Strategy-Induct** 与 ZCoT 之间的准确率差(蓝色/红色表示我们的方法获胜/失败)。 参见图说明图 4:LRMs 在移位密码 25 个子任务上的直接比较。准确率差值表示 **Strategy-Induct** 与 ZCoT 之间的准确率差(蓝色/红色表示我们的方法获胜/失败)。 ## 4 结果与分析

相似文章

Stratagem:通过轨迹调制博弈自博弈学习可迁移推理

Hugging Face Daily Papers

# 论文页面 - Stratagem:通过轨迹调制博弈自博弈学习可迁移推理 来源:[https://huggingface.co/papers/2604.17696](https://huggingface.co/papers/2604.17696) 作者:,,,,,,,,,, ## 摘要 STRATAGEM 通过引入推理可迁移性系数与演化奖励,鼓励抽象、跨领域模式而非博弈专用启发式,从而解决语言模型推理迁移受限的问题。博弈为开发通用推理能力提供了极具吸引力的范式。

发散诱导提示:零样本推理的多理由归纳

arXiv cs.AI

发散诱导提示(DIP)通过首先生成多个多样化的理由,将每个理由详细阐述为一个详细计划,然后归纳出最终计划,从而增强零样本推理,其性能优于单一策略提示方法。

从智能体轨迹中诱导推理原语

arXiv cs.AI

介绍推理原语诱导(Reasoning Primitive Induction)方法,该方法从成功的ReAct轨迹中挖掘,将重复出现的推理动作聚类为类型化的伪工具,在基准测试上比原始智能体高出数十个百分点。

STRIDE-ED: 一个策略驱动的多步推理框架用于同情心对话系统

arXiv cs.CL

STRIDE-ED 是一个为同情心对话系统设计的策略驱动推理框架,它结合了结构化的多阶段推理、数据精化管道和两阶段训练(有监督微调 + 多目标强化学习)来改进情感理解和回复生成。该框架在开源大语言模型上的自动评指标和人工评估上都展示了一致的改进。