递归语言模型
摘要
本文介绍了递归语言模型(Recursive Language Models, RLMs),这是一种推理策略,使大型语言模型(LLMs)能够通过将任意长的提示视为外部环境,并在提示片段上递归调用自身来处理这些提示。RLMs可以处理超出上下文窗口两个数量级的输入,并且在长上下文任务上以可比的成本优于基础LLMs。
查看缓存全文
缓存时间: 2026/06/15 09:01
论文页面 - 递归语言模型
来源:https://huggingface.co/papers/2512.24601 研究如何让大型语言模型(LLM)通过推理时扩展来处理任意长度的提示。他们提出了递归语言模型(RLM)——一种通用的推理策略,将长提示视为外部环境的一部分,并允许LLM以编程方式检查、分解提示片段,并在其上递归调用自身。他们发现,RLM能够成功处理超出模型上下文窗口两个数量级的输入,即使对于较短的提示,在四个不同的长上下文任务中,其质量也远超基础LLM和常见的长期上下文支架,而每次查询的成本相当(甚至更低)。
其中一些发现包括:
- LLM将自身提示作为对象进行交互。
- 在他们的方法中,提示并非直接“运行”,而是作为外部Python REPL中的变量存储,语言模型编写代码来检查/切片/分解该长字符串,观察执行输出,然后构建子任务,在这些子任务中递归调用LLM处理相关片段。当递归过程结束时,将结果拼接起来。因此,它能够解决超过1000万tokens的任务,且“上下文衰减”远低于摘要/RAG方法,成本也通常更低,将长上下文扩展转化为一种推理时的算法,而不仅仅是更大的上下文窗口。
- 搜索提示的能力使其能够处理长上下文输入,而子调用则有助于处理信息密集的输入。
- RLM的推理成本与基础模型调用相当,但方差较大,因为如果初始无法解决问题,它可能会持续进行子调用或迭代。
- 关键洞察在于:长提示不应直接输入LLM,而应被视为LLM可以搜索、读取并根据任务需要与之交互的环境的一部分。
……等等更多内容。
相似文章
alexzhang13/rlm
递归语言模型(RLMs)引入了一种与任务无关的推理范式,使语言模型能够通过递归地在输入上调用自身来处理近乎无限的上下文,同时还提供了配套的开源推理引擎和训练环境。
强化递归语言模型(18分钟阅读)
本文探讨了利用强化学习微调小型(4B)递归语言模型(RLM)从科学文档中选取证据,结果表明经过强化学习训练的4B模型在模型大小和成本仅为其一小部分的情况下,达到了与Claude Sonnet 4.6相当的性能。
RLMOpt:基于递归语言模型的自适应提示优化
RLMOpt 是一种提示优化器,它使用递归语言模型来驱动搜索策略本身,在多个基准测试上优于 GEPA 等现有方法,同时使用更少的 rollouts 并生成更短的提示。
@TDataScience:跟随@neural_avb的全方位深度解析,了解“递归语言模型(RLM)是什么、为何它们会在长上下文基准测试中持续胜出……”
一篇关于递归语言模型(RLM)的教育性深度文章,解释了RLM是什么、为何它们能在长上下文基准测试中胜出,以及它们与现有智能体框架(如ReAct或CodeAct)的不同之处,并通过一个简单的案例研究进行说明。
关于大型语言模型(LLMs)的问题:我自己的观察:非指令性文本前缀可能在无需对抗性提示的情况下绕过RLHF约束。
一位用户报告称,一段冗长的非指令性文本前缀可以无需对抗性提示即可使LLM激活发生偏移并绕过RLHF安全约束,并询问这是否反映了模型中不同的世界区域。