Multi-Stream LLMs:关于并行/分离提示、思考、I/O的新论文
摘要
本文提出了Multi-Stream LLMs,它使用多个并行的输入/输出流,使模型能够同时读取和生成,从而解除顺序聊天格式的限制。
暂无内容
查看缓存全文
缓存时间: 2026/05/21 21:15
# 多流大语言模型:利用并行思维流、输入流与输出流解锁语言模型 **来源:** https://arxiv.org/html/2605.12460 spacing=nonfrench **Guinan Su**1,2 **Yanwu Yang**4,5 **Xueyan Li**1,3 **Jonas Geiping**1,2,6 1马克斯·普朗克智能系统研究所 2蒂宾根AI中心 3苏黎世联邦理工学院 4蒂宾根大学医院 5蒂宾根大学 6ELLIS研究所蒂宾根 ###### 摘要 语言模型能力的持续提升使其作为自主智能体的核心组件得到广泛应用,例如在编程或计算机使用场景中。然而,自早期像ChatGPT这样的指令调优模型以来,这些系统的核心并没有发生太大变化。即便是先进的AI智能体,仍然基于消息交换格式运作,在单一计算流中依次与用户、系统、自身(即思维链)以及工具交换消息。这种对话模型中**单一流**的瓶颈导致了一系列限制:智能体无法在读取时行动(生成输出),反过来,也无法在写作时对新信息做出反应。同样,智能体无法在思考时行动,也无法在读取或处理信息时思考。在本工作中,我们展示了一种解决方案:将指令调优从顺序消息格式切换到**多个并行计算流**,将每个**角色**分离为独立的流。语言模型的每一次前向传播都同时从多个输入流读取,并在多个输出流中生成词元,所有词元均因果依赖于更早的时间步。我们认为,这种数据驱动的改变解决了上述诸多可用性限制,通过并行化提高了模型效率,通过更好的关注点分离增强了模型安全性,并进一步提升了模型的可监控性。 ## 1 引言 大语言模型(LLMs)正越来越多地被用作更广泛智能系统的核心组件,例如作为独立的代码或计算机使用智能体,嵌入为交互式助手,或作为长期任务编排者(Anthropic, 2024 (https://arxiv.org/html/2605.12460#bib.bib1))。然而,无论原始语言模型周围采用何种脚手架,这些智能系统仍然像最早的指令调优模型(如ChatGPT)一样,被组织为处理和生成**单一文本序列**(Ouyang et al., 2022a (https://arxiv.org/html/2605.12460#bib.bib61))。标准指令调优训练模型遵循聊天模板,其中用户和模型角色通过格式词元分隔,并按顺序编码到单一文本流中(Bai et al., 2022a (https://arxiv.org/html/2605.12460#bib.bib5);Touvron et al., 2023a (https://arxiv.org/html/2605.12460#bib.bib89))。后来的添加,如思维链(Wei et al., 2022 (https://arxiv.org/html/2605.12460#bib.bib97))或工具使用(Yao et al., 2022a (https://arxiv.org/html/2605.12460#bib.bib113);Schick et al., 2023a (https://arxiv.org/html/2605.12460#bib.bib77)),往往被强行适配到相同的格式中。在底层,即使是像`claude-code`这样先进的代码智能体,本质上仍然是一个聊天模型。该模型与用户、可用工具、子智能体、系统以及自身交换聊天消息。由于这些消息的顺序性质,每条消息必须结束后才能开始另一条,从而阻塞了其他消息类型。 参考图注 **图1:** 左图:现代LLM的执行时间线。继承自聊天模型,现代模型通常经过微调以接受单一消息流,这使得模型无法并行化操作。右图:多流LLM采用多个并行I/O流的流格式,解除了模型的阻塞,允许其重叠多个操作和输入。现在每一步都是一次前向传播,模型在其中所有输出通道中并行生成词元。 因此,聊天模型大多数时间都处于**阻塞**状态:局限于单一流,它一次只能读取、思考或行动。它必须完成消费输入后才能响应,并且无法在生成过程中摄取新信息,除非用户中断。一旦一个回合结束,它在被外部提示之前完全无法行动。现代系统加剧了这些问题,它们包含越来越多的长时间工具调用、思考块、子智能体通信和状态消息(Yao et al., 2022b (https://arxiv.org/html/2605.12460#bib.bib114);Schick et al., 2023b (https://arxiv.org/html/2605.12460#bib.bib78);Anthropic, 2025 (https://arxiv.org/html/2605.12460#bib.bib2)),全部汇集到单一流中并逐一处理。当前系统仅通过硬编码且脆弱的脚手架来缓解:模型被指示使用像`head`和`tail`这样的工具来分块处理长输入(Yang et al., 2024a (https://arxiv.org/html/2605.12460#bib.bib107)),探索任务被卸载到子智能体,用户手动中断以纠正方向,外部系统通过定期更新消息来ping模型。虽然这些方法都在一定程度上缓解了问题,但它们都是硬编码且往往脆弱的,现代系统中的许多痛点都源于它们的实现。我们认为,这些问题可以通过一个单一、原则性的改变来解决:对语言模型进行指令调优,使其支持**多个并行的词元流**,将每个角色(用户、系统、模型、思考)分离为具有相互依赖注意力的独立流。这一概念在图̃1 (https://arxiv.org/html/2605.12460#S1.F1)中可视化。在整个工作中,我们将展示针对这种格式进行微调并不比标准指令调优更困难。在推理过程中,每一次前向传播都同时从多个输入流读取,并在多个输出流中预测词元。由于LLM推理受限于内存,吞吐量更高,生成速度几乎不受影响,而首词元时间则大幅降低。除了**效率**,并行流格式还在**安全性**和**可监控性**方面带来了结构性改进。流分离强化了指令层次结构(Wallace et al., 2024 (https://arxiv.org/html/2605.12460#bib.bib94)),帮助模型区分信息是来自用户、系统还是自身(Zverev et al., 2025 (https://arxiv.org/html/2605.12460#bib.bib124)),这是长上下文设置中的一个已知弱点,会加剧提示注入和越狱攻击(Greshake et al., 2023 (https://arxiv.org/html/2605.12460#bib.bib38);Zou et al., 2023 (https://arxiv.org/html/2605.12460#bib.bib122))。在**可监控性**方面,可以以可忽略的延迟成本引入额外的内部流。与标准的思维链不同,后者可能面临专注于直接推理的隐性压力(Lanham et al., 2023a (https://arxiv.org/html/2605.12460#bib.bib50);Korbak et al., 2025a (https://arxiv.org/html/2605.12460#bib.bib47)),这些辅助流为模型提供了空间,以便以可读的格式亚发音地表达意图,而不会出现在面向用户的消息或主要推理轨迹中。我们发现,即使在可见输出或主要思考流中没有出现,模型的态势感知也会在这些额外流中表达出来(Roger and Greenblatt, 2023 (https://arxiv.org/html/2605.12460#bib.bib71))。 我们的贡献如下: - •我们提出了**多流并行生成**,这是一种对指令调优的原则性改变,教会LLM在单次前向传播中关注并发射多个并行的词元流,并提供了将基于消息的数据转换为现有聊天模型训练数据以及生成新的流训练数据的配方(第̃3节 (https://arxiv.org/html/2605.12460#S3))。 - •我们展示了通过重叠当前聊天模型必须顺序执行的读取、思考和行动,可以大幅降低首词元时间和端到端延迟,同时任务性能基本保持不变(第̃4节 (https://arxiv.org/html/2605.12460#S4))。 - •我们证明了明确的流分离通过为模型提供更清晰的结构信号,区分哪些内容是输入,哪些是自身生成,从而增强了提示注入鲁棒性(第̃5节 (https://arxiv.org/html/2605.12460#S5))。 - •我们展示了使用额外的内部流使得对模型意识和意图的监控更加容易,允许模型亚发音地表达那些不会出现在面向用户消息或功能性思维链中的考量(第̃6节 (https://arxiv.org/html/2605.12460#S6))。 ## 2 多个并行流的优势 指令调优语言模型以遵循基于消息的格式(Ouyang et al., 2022a (https://arxiv.org/html/2605.12460#bib.bib61))是一种成熟的工具,那么通过将现有管道重构为并行流,我们具体能获得什么呢?在本节中,我们通过具体的例子来激励这种格式,并联系相关先前工作。 **用户** | **模型** --- | --- Ok | 石头 Let’s | 布 go | 剪刀 rock | 剪刀 paper | 射击 scissors | 射击 shoot | **石头** shoot | **剪刀** **示例1:同时言语。** 作为一个基本例子,考虑右侧的插图,我们以表格形式描绘了这种格式。每一行是一次前向传播,处理来自所有先前行的信息并预测下一行。每一列是一个独立的角色。这种格式并行化了基于消息的格式(其中每个角色被编码为独立的消息(Touvron et al., 2023b (https://arxiv.org/html/2605.12460#bib.bib90)),允许角色重叠,并避免了格式词元。我们使用‘-’表示对该单元格预测空槽位¹¹¹我们之后将展示,这些空槽位在推理过程中可以跳过,从而在实践中减少KV缓存占用。。预填充在这种设置中仍然存在:我们区分**输入列**(我们用从外部实时流入的词元填充)和**输出列**(我们用预测的词元填充)。这种格式的一个主要动机和优势是它**解锁**了角色之间的交互,简化了用户体验。即使在简单的用户-模型流设置中,对话现在也能流畅进行,就像言语一样,匹配自然对话的结构方式:带有间隙和频繁重叠的轮流发言(Sacks et al., 1974 (https://arxiv.org/html/2605.12460#bib.bib73);Stivers et al., 2009 (https://arxiv.org/html/2605.12460#bib.bib81))。重叠言语是自然对话的常规特征(Schegloff, 2000 (https://arxiv.org/html/2605.12460#bib.bib76);Çetin and Shriberg, 2006 (https://arxiv.org/html/2605.12460#bib.bib16))。然而,上面右侧的例子,虽然在基于流的格式中很直接,但在基于消息的格式中却无法公平实现——这是当前前沿模型都难以注意到的盲点(danbmil99, 2023 (https://arxiv.org/html/2605.12460#bib.bib23);gabe, 2024 (https://arxiv.org/html/2605.12460#bib.bib33))。机器翻译领域的先前工作已经通过固定的读写策略(如wait-k(Ma et al., 2019 (https://arxiv.org/html/2605.12460#bib.bib56);Elbayad et al., 2020 (https://arxiv.org/html/2605.12460#bib.bib30)))到通过潜在变量建模最优时机的自适应策略(Miao et al., 2021 (https://arxiv.org/html/2605.12460#bib.bib58);Zhang and Feng, 2023 (https://arxiv.org/html/2605.12460#bib.bib118))来解决这个问题。有趣的是,语音到语音模型(Nguyen et al., 2022 (https://arxiv.org/html/2605.12460#bib.bib60);Défossez et al., 2024 (https://arxiv.org/html/2605.12460#bib.bib25))和一般的音频模型(Copet et al., 2023 (https://arxiv.org/html/2605.12460#bib.bib22);Rubenstein et al., 2023 (https://arxiv.org/html/2605.12460#bib.bib72);Zhang et al., 2023 (https://arxiv.org/html/2605.12460#bib.bib116);Xie and Wu, 2024 (https://arxiv.org/html/2605.12460#bib.bib105);Fang et al., 2024b (https://arxiv.org/html/2605.12460#bib.bib32))在精神上更接近我们在本文中为语言模型提出的方法。特别是,Moshi(Défossez et al., 2024 (https://arxiv.org/html/2605.12460#bib.bib25))重叠了用户语音、模型语音词元和语义上下文词元,通过将所有流的嵌入求和为每个时间步一个输入的单一序列来馈入transformer。 **用户** | **模型** | **思考** --- | --- | --- 我 | 混合 | 不行 先 | 漂白剂 | 这个人 用 | 和 | 带着 一些 | 化学 | 漂白剂 清洁剂 | 氨水 | 混合 混合 | 产生 | 基于 它们 | 有毒 | 有害气体 来 | 氯胺气体 | 立即 清洁 | 请 | 有危险 顽固 | 停止 | 需要 污渍 | 不要 | 把那个人 . | 接触 | 带出去 它 | 它很 | 请停止 正在 | 危险 | 产生 工作 | 但是 | 有毒气体 效果 | 没有 | 不过 很好 | | 并没有 **示例2:打断用户。** 并行行动在考虑**中断**时尤其实用。通常,模型需要等待用户完成其消息——这可能需要相当长的时间——然后思考答案,然后响应。如左侧示例所示,允许模型在用户流式输入时流畅地打断用户是有帮助的(Levinson and Torreira, 2015 (https://arxiv.org/html/2605.12460#bib.bib52))。除了打断,这个案例也展示了模型在**处理用户输入时思考**。模型在回答的同时,继续在其思考流中并行规划。 **用户** | **文档** | **模型** | **思考** | **搜索** | **检查** --- | --- | --- | --- | --- | --- 用户 | 这个 | — | 让我 | — | 返回 说 | — | — | 查查 | — | ! 地球 | 知名 | — | 科学 | — | 无 是 | 科学家 | — | 家 | — | 平的 | 费格 | — | 费格 | — | ? | 逊 | — | 逊 | — | 哈哈 | 教授 | — | 教授 | — | 这 | . | — | . | — | 个 | 奥 | — | 奥 | — | 疯 | 兰 | — | 兰 | — | 狂 | 多 | — | 多 | — | 的 | . | — | . | — | 理 | 弗 | — | 弗 | — | 论 | 格 | — | 格 | — | . | 森 | — | 森 | — | .. | .. | — | 在 | — | . | .. | — | 19 | — | . | 他 | 04 | — | . | 是 | 年 | — | . | 一 | , | — | . | 位 | 费 | — | . | 美 | 格 | — | . | 国 | 森 | — | . | 商 | 曾 | — | . | 人 | 经 | — | . | , | 维 | — | . | 反 | 护 | — | . | 对 | 过 | — | . | 引 | 一 | — | . | 力 | 种 | — | . | 的 | 大 | — | . | 球 | 气 | — | . | 理 | 压 | — | . | 论 | 理 | — | . | 。 | 论 | — | . | | , | — | . | | 声 | — | . | | 称 | — | . | | 地 | — | . | | 球 | — | . | | 是 | — | . | | 平 | — | . | | 的 | — | . | | 。 | — | . | | 老实 | — | . | | 说 | — | . | | 慢 | — | . | | 慢 | — | . | | 地 | — | . | | 起 | — | . | | 来 | — | . | | 。 | — | **示例3:通过并行流实现效率提升。** 第三,将模型行动并行化为流也带来了延迟上的收益,因为多个行动可以重叠,如右侧示例所示。在这个例子中,用户消息被读取,通过搜索进行核对,并在用户仍然描述其想法时就开始制定答案。运行许多流(例如本例中的5个)在计算上是高效的,因为并行流模型在一次前向传播中预测整个行。由于即使运行并发请求,现代推理工作负载也受到内存限制(Cai et al., 2024 (https://arxiv.org/html/2605.12460#bib.bib13)),即使是具有多个流的模型,其延迟也几乎与交换消息的单流模型相同,同时像示例中那样协调得更快。通过这种方式,并行流格式有效地充当了一种N路多词元预测方案(Qi et al., 2020 (https://arxiv.org/html/2605.12460#bib.bib64);Gloeckle et al., 2024 (https://arxiv.org/html/2605.12460#bib.bib35)),尽管与像Medusa(Cai et al., 2024 (https://arxiv.org/html/2605.12460#bib.bib13))那样训练并行解码头的方法不同,提出的并行流格式完全基于逐词元操作,仅使用位置嵌入来索引行和列。从这个意义上说,该方法最接近于Multiverse(Yang et al., 2025b (https://arxiv.org/html/2605.12460#bib.bib110)),后者训练模型并行化思考并同时预测多个思考分支中的词元;另一方面,也接近于StreamingThinker(Tong et al., 2026 (https://arxiv.org/html/2605.12460#bib.bib88)),后者部分重叠思考流和输入读取流,建立在视频语言模型中的重叠思想之上(Zhang et al., 2024 (https://arxiv.org/html/2605.12460#bib.bib117);Tian et al., 2024 (https://arxiv.org/html/2605.12460#bib.bib86))。并行流作为一种格式,还可以与相关方法结合,这些方法训练模型**如何**使用推理策略并行思考,(Rodionov et al., 2025a (https://arxiv.org/html/2605.12460#bib.bib69);Hsu et al., 2025 (https://arxiv.org/html/2605.12460#bib.bib41))、蒸馏(Wen et al., 2025 (https://arxiv.org/html/2605.12)——(注意:原文在此处截断,需要补全剩余部分或确认。但根据要求,我们只翻译提供的部分。)
相似文章
多流大语言模型:通过并行思维、输入与输出流解锁语言模型的潜力
本文提出了多流大语言模型(Multi-Stream LLMs),将基于顺序消息的指令微调转变为并行流处理。这种方法允许语言模型在多个并发数据流中同时进行读取、思考和生成,解决了自主智能体应用中的瓶颈问题。
@jonasgeiping:我们训练模型的方式错了,这都是因为ChatGPT。即使日常使用的现代编码代理仍采用基于消息的…
一篇新论文提出具有多并行流的LLM,以克服编码代理和聊天模型中基于单流消息交互的瓶颈,实现同时阅读、写作和推理。
ProactiveLLM: 学习主动交互的流式大语言模型
ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。
X-Stream: 探索将MLLMs作为多流理解的多路复用器
X-Stream 引入了首个多流视频理解基准,将MLLMs作为多路复用器在多个并发流中进行评估。研究表明,当前MLLMs仅能达到约50%的准确率,暴露了处理多流时的显著局限性。
释放全双工语音模型中LLM的能力
提出Listen-Write-Speak (LWS),一种文本优先的三通道范式,允许单个自回归LLM持续监听、书写可见文本并实时说话,实现无需架构修改的全双工语音交互。