多样本思维链上下文学习:让上下文学习真正学会
摘要
本文研究了推理任务的多样本思维链上下文学习,揭示了标准扩展规则并不适用,并提出了Curvilinear Demonstration Selection (CDS)方法以改进示例排序,最高可获得5.42个百分点的性能提升。
查看缓存全文
缓存时间: 2026/05/14 04:16
论文页面 - Many-Shot CoT-ICL: 让上下文学习真正学会
来源:https://huggingface.co/papers/2605.13511
发布于5月13日
·
由
Cindy (https://huggingface.co/ttchungc) 于5月14日提交
摘要
对于推理任务,多示例上下文学习(Many-shot in-context learning)展现出与非推理任务不同的缩放行为,其中示例的顺序和选择会显著影响性能。
上下文学习(In-context learning, ICL)通过将提示中的示例作为条件,使大语言模型(Large Language Models, LLMs)适应新任务,而无需更新参数。借助长上下文模型,多示例ICL可使用数十到数百个示例,并达到与微调相当的性能,然而目前对其缩放行为的理解主要来自非推理任务。我们研究了多示例思维链上下文学习(Many-shot chain-of-thought in-context learning, CoT-ICL)在推理任务上的表现,发现标准的多示例规则并不适用。在非推理型和面向推理型LLM之间,以及非推理和推理任务之间,我们发现:(i)一种依赖于设定的缩放效应:增加CoT示例数量对非推理型LLM不稳定,主要有利于面向推理型LLM;(ii)基于相似性的检索有助于非推理任务,但在推理任务上失效,因为语义相似性难以预测过程(即CoT)兼容性;(iii)一种顺序缩放效应:随着CoT示例数量增加,性能方差会增大。我们将这些行为解释为:多示例CoT-ICL本质上是一种上下文测试时学习(in-context test-time learning)而非规模化的模式匹配,并提出了两条原则:(i)示例应易于目标模型理解,(ii)示例排序应支持平滑的概念递进。基于这些原则,我们提出了曲线演示选择(Curvilinear Demonstration Selection, CDS),一种简单的排序方法,在使用64个示例的几何任务上可获得高达5.42个百分点的提升。总体而言,我们的研究将长上下文窗口从检索缓冲区重新定义为一种用于上下文测试时学习的结构化课程。
查看 arXiv 页面 (https://arxiv.org/abs/2605.13511)
查看 PDF (https://arxiv.org/pdf/2605.13511)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13511)
在你的 Agent 中获取这篇论文:
hf papers read 2605.13511
没有最新的 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2605.13511 即可从此页面链接。
引用此论文的数据集0
没有数据集链接到这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2605.13511 即可从此页面链接。
引用此论文的 Space0
没有 Space 链接到这篇论文
在 Space README.md 中引用 arxiv.org/abs/2605.13511 即可从此页面链接。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
基于代理上下文的链式思维微调长上下文推理
提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。
ACIL: 用于上下文学习的自动Chain-of-Thought
本文介绍了ACIL,一种自动Chain-of-Thought框架,通过生成和修剪推理链来增强上下文学习,从而提升LLM在复杂任务上的表现。
超越表面模仿:多模态上下文学习中推理路径对齐的对比建模
本文介绍了一种用于多模态上下文学习的对比建模框架,旨在改进推理路径对齐,提升视觉问答等任务的性能。
有限监督下的链式思维推理再探讨:半监督链式思维学习
本文介绍了Semi-CoT,一种用于链式思维推理的半监督学习框架,该框架利用未标记问题并通过基于熵的选择生成可靠的伪推理链,在数学推理基准上展示了有希望但混合的结果。
高效推理蒸馏:通过合成思维链与难度感知微调的小型视频语言模型
本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。