大语言模型从规则中学得比从示例中更好
摘要
本文对比了大语言模型中基于规则与基于示例的上下文学习,发现规则在各类任务中通常能带来更可靠的学习效果,并探讨了模型特性与任务特性对此的影响。
arXiv:2609.03213v1 公告类型:新研究
摘要:大语言模型具备上下文学习能力,能够通过提示上下文学习新任务而无需更新模型权重。我们比较了两种主要的上下文学习模式的学习效果:(1) 通过规则描述进行学习(指令遵循);(2) 通过输入输出示例演示进行学习(少样本提示)。通过五项涵盖不同领域(游戏、算术、语言推理)的学习任务,我们对比了两种学习模式(规则 vs. 示例)在指定相同底层任务时的效果。我们进一步探索了调节学习效果的模型与任务特性。研究发现,模型通常从规则中学习比仅从示例中学习更可靠,在规则基础上增加更多示例或单纯增加示例数量并不能带来稳定且显著的收益。指令微调能增强基于规则学习的收益,同时保持基于示例的学习能力不变。令人惊讶的是,我们发现基础模型中并未体现出基于示例学习的特权效应,且在代数任务领域中规则仍能带来收益。总体而言,当任务涉及代数抽象与计算时,规则相对于示例的比较优势更大;而当任务需要分布敏感性或调用参数化知识时,这种优势则较小。
查看缓存全文
缓存时间: 2026/09/04 05:55
# 大语言模型从规则中学习上下文的效果优于从示例中学习 来源:https://arxiv.org/html/2609.03213 Seungmin Cho 隶属机构:波士顿大学 邮箱:[[email protected]](mailto:[email protected]) Yukyung Lee 隶属机构:波士顿大学 邮箱:[[email protected]](mailto:[email protected]) Najoung Kim 隶属机构:波士顿大学 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 大语言模型(LLMs)具备上下文学习能力,能够通过提示上下文中的信息学习新任务而无需更新模型权重。本研究对比了两种主流上下文学习模式的学习效果:(1)从规则描述(指令遵循)中学习;(2)从输入-输出示例(少样本提示)中学习。通过覆盖多个领域(游戏、算术、语言学推理)的五项学习任务,我们对比了两种指定相同底层任务的学习模式(规则与示例)的效果。我们进一步探索了影响学习效果的模型与任务特性。研究发现:模型通常从规则中学习比仅从示例中学习更可靠;在规则基础上增加示例,或单纯增加示例数量,并不能带来一致且显著的收益提升。指令微调增强了基于规则学习的效益,同时保持了基于示例学习的能力。令人惊讶的是,我们发现基础模型中基于示例的学习并无特殊优势,且在代数任务领域中规则仍能带来收益提升。总体而言,当任务涉及代数抽象与计算时,规则相对于示例的比较优势更大;而当任务需要分布敏感性或依赖参数化知识时,该优势则较小。 ††脚注文本: \*同等贡献。 图1:实验设计可视化。(A)展示任务类型,(B)呈现同一任务在不同学习条件下的呈现方式。 ## 1 引言 大语言模型(LLMs)已被证明具备上下文学习能力,即无需更新权重即可从提示上下文中学习任务(Brown et al., 2020;Chung et al., 2024;Lampinen et al., 2024)。任务在上下文中传递的两种主要方式为:(1)通过任务的语言描述或指令(Sanh et al., 2022;Chung et al., 2024)(指令/规则学习);(2)通过输入-输出示例(Brown et al., 2020)(示范/示例学习)。近期研究(Davidson et al., 2026)表明,即使两种学习模式指定相同的底层任务,LLMs也不会推导出单一的通用函数向量表征,而是激活部分重叠的机制。这为实践中将规则与示例结合用于同一任务提供了支持。然而,不同的机制并不必然意味着结合后能带来性能的叠加提升。 本文旨在系统对比基于规则与基于示例的新型复杂任务学习效果,探究其学习效率,并进一步阐明影响学习效率的学习者与任务特性。最接近的工作是Liu et al. (2024),他们报告了规则学习在规则正确时普遍优于示例学习的结论(尽管其主要关注规则推断的关系)。我们通过一系列新颖任务的上下文学习实验,对比规则与示例学习的效果。我们聚焦于需要复杂推理的任务,即涉及推断多个关系属性或有效输入-输出映射背后的单一潜在变量(如“国家-首都”任务)。我们的任务涵盖游戏(Set Game和Tapatan)、算术(Operator Function)和语言学推理(Noun Class Agreement和Lexical Category Inference)领域。 我们在三种不同的学习设置中实例化每个任务:规则、示例以及组合(规则+示例),并在相同的测试项上进行评估。该设计使我们能在固定潜在任务的同时,仅改变任务的传递方式。 研究问题如下: - **RQ1**:模型从规则(指令)还是示例(示范)中学习复杂新颖任务更可靠? - **RQ2**:学习者特性(尤其是指令微调)对规则与示例学习效率有何影响? - **RQ3**:任务本身的哪些特性使其更适合/不适合从规则或示例中学习? 跨任务领域与模型类型,我们发现基于规则的学习总体上优于基于(最小覆盖)示例的学习。在规则基础上添加示例或增加上下文示例数量,均未带来一致且显著的收益提升。此外,规则的优势程度因任务性质差异显著:当任务涉及代数抽象与计算时,规则相对于示例的比较优势更大;当任务需要分布敏感性或依赖参数化知识时,该优势较小。这为未来研究开辟了有趣方向:如何根据任务特性预测不同上下文学习方法的效果,以及如何为规则学习收益有限的任务开发更优方法。 ## 2 方法 我们设计了涵盖多个领域的五项任务,并将这些任务实例化为基于规则和基于示例的上下文提示。我们额外加入了“组合”提示,同时提供规则和示例。每个任务领域包含三个任务变体,对应三个难度级别(详见第2.3节)。我们为每个任务程序化生成数据集,并划分为训练集和测试集;训练集仅在上下文提供示例时相关。所有学习设置均在相同测试项上评估。更多实验细节见附录A和B。 ### 2.1 模型 我们评估了Gemma 3、Qwen 2.5、Qwen 3和OLMo 3/3.1的基础模型和指令微调检查点,模型参数规模从7B到32B不等。我们还通过OpenAI API评估了GPT-5.4(OpenAI, 2026),使用API模型标识符`gpt-5.4`作为强参考基线。完整模型列表和计算配置见附录A.2(表2)。 ### 2.2 学习条件 每个任务通过以下三种学习条件呈现给目标模型。所有提示结构详见表8(附录F)。 ##### **仅规则** 提示包含任务规则的语言描述,后跟测试问题的输入。规则描述明确说明有效答案格式。规则提示经过多次修订,以确保忠实传达预期任务并消除无意歧义。我们未针对任务性能优化提示。完整规则提示见附录F。 ##### **仅示例** 提示包含有效的输入-输出示范,后跟测试问题的输入。无明确的任务描述或格式指令,但每个示范直接呈现预期输出格式。示范集还根据最小覆盖设计(第2.5节)提供所有输出标签(如适用)。每个任务的示例输入-输出映射见附录B.1。 ##### **组合** 提示包含与仅规则条件相同的规则描述,后跟仅示例条件中的输入-输出示例,再接测试问题。因此,组合条件同时提供两种信息。 ### 2.3 任务难度条件 我们为每个任务创建三个对应难度级别的版本:易、中、难。这些级别与需表征和跟踪的变量数量、变量的可能取值以及计算输出所需的推理步骤数量相关。基于规则的任务描述的优势在于,与固定示例集相比,它能更紧密地约束假设空间,从而更稳健地覆盖可能的输入-输出(包括边界情况)。当可能的输入-输出映射空间增长(即我们操作化的难度级别增加)时,这一优势可能更明显。 我们实施难度条件旨在检验LLMs的上下文学习是否确实表现出规则学习的理论优势。若是如此,我们应该观察到基于规则的学习在不同难度级别上产生比基于示例学习更稳健的学习结果。我们在第2.4节的任务描述中简要讨论难度的操作化方式,并在表1(附录A.1)中提供完整描述。 ### 2.4 任务设计 我们的五项任务涵盖游戏、算术和语言学推理等多个领域。以下讨论每项任务的设计。尽管部分任务受已知任务启发(如Set Game),但由于我们引入了规范上的变化(例如,集合规则可能要求仅两张卡片具有相同属性值而另一张不同,这偏离了游戏原规则),我们预期这些任务是足够新颖的学习问题。此外,经验表明此类变化确实使这些任务在上下文中难以学习(Wu et al., 2024)。 对于每项任务,我们还基于任务性质简要讨论了关于学习条件影响的假设——任务集旨在覆盖广泛的假设范围,我们对规则或示例学习是否对该任务有效持有不同的先验。 #### 2.4.1 Set Game 该任务是Wu et al. (2024) Set Game的变体(图1,A1)。玩家需从棋盘上的9张卡片中选择3张组成一个“集合”。每张卡片关联一系列属性(如动物、栖息地),三张卡片是否构成集合由预定义规则决定。给定棋盘上9张卡片的信息,模型必须根据(显式或可推断的)有效集合规则选择三张卡片。我们预测规则学习对此任务更有效,因为集合决策所需的“相同/不同”判断涉及变量的代数抽象,模型可能更难通过示例分布推断。 我们预期该任务的难度受属性数量、每个属性的可能值数量以及确定集合条件的规则复杂度的调节。 #### 2.4.2 Tapatan 该任务是Tapatan(一种双人棋盘游戏)的变体(图1,A2)。Tapatan传统在3×3棋盘上进行,两名玩家轮流放置棋子直至所有棋子放置完毕,然后将棋子移动至相邻坐标点。游戏目标是在对手之前将三个棋子连成一线。水平、垂直或对角线连线均有效。 本任务中,模型接收以n×n网格呈现的棋盘状态。每个单元格包含`A`、`B`或`.`,分别表示A玩家棋子、B玩家棋子或空位。行从上到下列出,列从左到右排列;第x列第y行的单元格坐标为(x,y)。 给定两名玩家(A和B),可能的游戏结果有:A玩家胜、B玩家胜、继续(即无人获胜)。正确解决此任务需识别由坐标相邻性决定的获胜条件。由于相邻性在棋盘状态描述中易于识别为模式,我们预期基于示例的学习对此任务有效,尽管我们对其相对于规则的效率尚无假设。 我们预期该任务的难度受棋盘尺寸(n×n)、每名玩家可放置的棋子数量以及被视为获胜连线的棋子数量调节。 #### 2.4.3 Operator Function Operator Function(图1,A3)旨在评估模型在算术领域的学习效率。Operator Function引入了一个由熟悉的基本运算符(如乘法、加法)组成的新算术运算符。本任务中,模型接收一个包含新定义运算符的算术问题,该运算符由n个运算符和n+1个参数组成,必须使用新定义的运算符函数回答问题。 我们预测规则学习对此任务将更有效,因为任务需要代数推理和运算的序列化应用。我们预期该任务的难度受构成函数的基本运算符数量调节(由于所有基本运算符均为二元运算符,这也线性增加了参数数量)。 #### 2.4.4 Noun Class Agreement Noun Class Agreement(图1,A4)是一项人工语言学习任务,需要学习的关键信息是语言中名词的类别。目标语言表现出一致现象,其他句法类别(如形容词、动词)的词形根据其一致的名词类别而变化。任务形式为语法性判断,模型必须根据给定句子是否合乎语法输出“是”或“否”。 示例的不合语法性完全源于名词类别一致性的违反。由于名词类别一致性通常是通过分布学习获得的……(后续内容因原文截断未提供翻译)
相似文章
LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
Cross-LLM推理一致性:来自共享交互的证据
本文利用基于交互的解释方法,研究了不同LLM在预测相同词元时是否共享共同的推理模式。结果表明,先进LLM展现出一致的交互模式,暗示它们隐式地优化到了共享的推理机制。
LLMs在学术工作流中的应用:对短上下文窗口与长上下文窗口LLMs生成文献综述的评估
本文评估了使用短上下文窗口和长上下文窗口的大语言模型生成的文献综述,发现较长的上下文能提高信息整合能力,但加剧了重复和描述性过强等问题,因此需要人工监督以确保学术标准。
上下文学习运作于概念子空间学习
本文提出,大型语言模型中的上下文学习通过低维概念子空间运作,任务相关信息集中在表示空间的一小部分中,并在Llama-3-8B和Qwen2.5-7B上通过实验得到支持。
LLMs 何时真正有效?评估 LLMs 作为数据质量标注器
本研究评估了 LLMs 在电子商务任务中作为数据质量标注器的表现,发现当需要背景知识时,它们优于基线方法,但对于具有强烈词汇信号的任务优势有限,同时展示了跨运行的高度一致性。