Latent-IM:用于语音LLM的潜在交互管理

arXiv cs.CL 论文

摘要

介绍了Latent-IM,一个从冻结的语音LLM中恢复交互管理的框架,利用基于激活的选择和引导来进行会话动作。相比未引导的主干模型,它将端到端动作准确率提升了12.5个百分点。

arXiv:2607.26928v1 公告类型:新 摘要:经典的语音对话系统通常将对话管理与响应实现分离:策略选择下一个对话动作,生成组件表达该动作。随着对话系统向LLM转变,这种分解在很大程度上消失在模型的隐藏表示中。我们探究是否可以从LLM内部恢复状态估计和动作控制的类似机制,用于诸如确认、检查、询问、解释和回答等会话动作。我们将动作控制公式化为两个耦合问题:选择(从对话上下文中预测合适的下一个动作)和实现(在生成时因果性地产生所选动作)。我们提出了Latent-IM,一个内部对话管理框架,它提供了一个通用接口,用于在不同目标下选择和部署会话动作。在此,我们利用该控制来复现人类的动作选择,将平均端到端动作准确率相比未引导的主干模型提升了12.5个百分点,同时表现与微调相当。
查看原文
查看缓存全文

缓存时间: 2026/07/30 10:00

# 潜在交互管理:面向语音大型语言模型的交互管理框架

来源: https://arxiv.org/html/2607.26928

###### 摘要

传统口语对话系统通常将对话管理与响应的实现分离开来:策略选择下一个对话动作,生成组件表达该动作。随着对话系统向LLM转变,这种分解在很大程度上已消失在模型的隐藏表示中。我们提出一个问题:能否从LLM内部恢复出状态估计和动作控制的类似机制,用于对话行为,例如确认、检查、询问、解释和回复?我们将对话行为控制表述为两个耦合问题:*选择*——从对话上下文中预测合适的下一个行为,以及*实现*——在生成时因果地产生所选行为。我们引入Latent-IM,一个内部对话管理框架,提供通用接口,用于在不同目标下选择和部署对话行为。本文中,我们利用此控制来复现人类的行为选择,在端到端行为准确率上比未引导的骨干模型平均提升12.5个百分点,性能与微调相当。

## 引言

经典对话系统通常将对话建模为状态-动作控制问题。对话管理器维护对话状态的表示(通常是不确定性下的信念状态),策略选择下一个系统动作。这种分解在部分可观察马尔可夫决策过程(POMDP)方法中尤为重要,其中噪声观测被整合到信念状态中,并选择动作以最大化期望对话成功(Williams and Young 2007; Young et al. 2013)。现代LLM则采用端到端方法,直接从对话历史生成响应,无需显式的状态管理或动作策略。尽管现代LLM缺乏显式的状态和策略模块,但它们仍需解决相同的底层控制问题:确定在当前上下文中哪个对话动作是合适的(Shaikh et al. 2024; Maitra et al. 2025; Luo et al. 2025; Avsian and Heck 2026; Nguyen et al. 2023; Veluri et al. 2024; Lee et al. 2025)。因此,该决策必须在LLM的隐藏激活中隐式地表示和解决。这引出了我们的核心问题:能否从这些表示中恢复出状态估计和动作控制的内部类似机制,并用它来支配对话行为?我们引入Latent-IM,一个从冻结语音LLM的表示中恢复交互管理(Interaction Management, IM)的框架。我们将IM操作化为决定模型应采取哪个局部对话动作以及何时应让出话轮。具体而言,我们研究支持接地、信息交换和不确定性消解的五种行为。沿袭经典的状态-动作分解,Latent-IM将*选择*(从残差流激活中预测下一个行为,达到0.60的平均准确率)与*实现*(使用激活引导来表达该行为,比最强基线高出10.4个百分点)分开。一个互补的话轮边界方向控制响应何时终止,在引导范围内单调地将平均响应长度从71.3个单词变化到10.4个单词。我们的贡献如下:

- • 我们将基于激活的选择与实现结合成Latent-IM,一个无需黄金行为或骨干模型更新的端到端对话管理系统,性能优于其他控制基线,并与监督微调相当。
- • 我们展示了一个轻量级流式控制器可以从冻结的语音LLM激活中恢复对话状态,在三个面向任务的对话数据集上优于基于文本转录的选择器。
- • 我们推导出可复用的行为特定激活方向,这些方向因果地实现对话动作。从MapTask学习到的方向无需重新估计即可迁移至FindTask和CReST,并且优于提示工程、候选选择和解码时控制的基线。
- • 我们识别出一个独立的话轮边界方向,能因果地控制响应长度,并将其与实现感知门控集成,以调节模型何时让出话轮。

## 相关工作

#### 对话状态、策略与对话分析。经典面向任务的对话系统将对话管理框架化为状态跟踪后跟动作选择。有限状态和基于框架的系统显式表示任务进度和槽值,而POMDP方法维持对潜在对话状态的信念以支持在不确定性下的动作。对话分析与对话行为理论通过描述交互过程中的顺序动作(如接地、修复、确认、澄清和响应)来补充这一观点(Clark and Brennan 1991; Traum and Hinkelman 1992; Sacks et al. 1974; Schegloff et al. 1977; Purver et al. 2001)。虽然经典系统提供了显式的状态/动作抽象,但它们通常受限于领域特定的意图、槽位和模板。最近的工作如NextLat通过潜在预测目标诱导出类似信念的内部状态(Teoh et al. 2025)。相反,我们从冻结LLM的残差流中恢复对话状态,并将动作表示为领域通用的对话行为。

#### LLM与激活引导。LLM能够生成流畅的对话,但在接地和修复方面表现不足,会在歧义情况下过早回答,偏离人类对话行为分布(Shaikh et al. 2024; Maitra et al. 2025; Luo et al. 2025; Dokme et al. 2026)。先前的工作使用内部表示在推理时修改模型行为(Li et al. 2023; Todd et al. 2024; Panickssery et al. 2023; Avsian et al. 2026; Subramani et al. 2022; Dokme and Heck 2026; Zou et al. 2023)。激活加法(Activation Addition)构建针对情感、主题、毒性等属性的对比方向(Turner et al. 2024),而诸如conceptor steering等方法捕获更丰富的激活结构(Postmus and Abreu 2024)。最近的工作将激活引导扩展到语音和音频语言模型,包括时间音频注意力、语音自适应和打断控制(Chang et al. 2026; Lin and Lee 2026; Yegorova et al. 2026)。我们的工作则针对局部的、上下文依赖的对话动作,通过分离何时应该选择一个动作与如何因果地实现该动作来实现可控生成。

## 任务与数据

我们研究在非对称、面向指令的任务对话中对话行为的可控生成。设一个对话DD为一连串话轮 D=((r1,u1),...,(rT,uT)),其中rt和ut分别表示第t轮的角色和话语。所有数据集包含两个非对称的参与者角色,我们称之为*给予者*(giver)和*跟随者*(follower)。给予者提供任务相关的指令或信息,跟随者基于这些信息行动。我们专注于跟随者的话轮,因为它们展现了更丰富、更具交互导向的行为清单。对于一个跟随者话轮t,之前的上下文为 ct=((r1,u1),...,(rt−1,ut−1)),而人类响应ut具有黄金行为标签 yt∈M={acknowledge, check, explain, query, reply}。我们将每个数据集的标注映射到这个共享分类法,定义于表1。这些标签捕获领域通用的交互功能,而非任务特定的意图。话轮完成被单独建模,不包含在M中。

我们将行为控制分解为两个任务。*选择*从对话上下文中预测合适的跟随者动作: pθ(yt∣ct)=sθ(ct), ŷt=argmaxm∈M pθ(yt=m∣ct)。*实现*生成一个以目标动作为条件的响应: ût=gφ(ct,yt⋆)。在预言实现实验中,yt⋆=yt 是黄金人类动作。在端到端设置中,yt⋆=ŷt 由控制器选择。因此,选择决定了*哪个*对话行为要执行,而实现决定了该行为*如何*被表达。

表 1:合并后的跟随者行为类型。

### 数据集

我们在三个对话数据集上评估该公式。

#### MapTask。我们的主要数据集是 MapTask (Anderson et al. 1991),一个无脚本、面向任务的口语对话集合,其中两位参与者协作在地图上重现一条路线。给予者有一张标有路线的地图,而跟随者有一张相关但不完全相同的地图,必须根据口头指令绘制路线。

#### FindTask。我们还使用了 RoboHelper 语料库中的 FindTask (Chen and Di Eugenio 2013),包含面向任务的人-机器人对话,参与者与一个机器人助手协作以定位物体、交换任务信息并解决误解。

#### CReST。最后,我们包含印第安纳协作远程搜索任务(CReST)语料库 (Eberhard et al. 2010),其中一位指导者查看一张室内地图,引导一位远程连接的合作者穿过环境。

参考图注

Figure 1: (a) 在生成之前,控制器预测下一个对话行为、是否以及多强地应用行为引导,以及合适的话轮长度(通过话轮边界强度)。这些预测在推理时无需黄金标签。本例中,控制器选择 QUERY(询问)作为下一个行为。(b) 在生成过程中,选定的行为方向v_query和话轮边界方向v_EOT以强度α和β注入到选定的Transformer层。这导致冻结的骨干模型实现所选行为并在合适的边界处终止。

## 方法

Latent-IM在冻结的语音LLM内部恢复出经典的对话管理流水线(图1)。一个循环控制器读取残差流摘要来维持对话状态并选择下一个对话行为,然后通过行为特定的激活引导来实现该行为,而不是使用符号策略或基于模板的生成。

### 基于LLM的对话状态与行为选择

控制器是一个轻量级有状态侧车模块,从冻结的骨干模型读取均值池化的残差流激活。对于每个上下文话轮τ。mix.wav,转换为单声道,并重采样至16kHz。生成时,音频段从紧接在上一话轮起始前0.2秒开始,到目标跟随者响应的起始处结束,确保保留的响应从不包含在内。音频段上限为30秒,当可用上下文更长时,保留最近的音频。对于教师强制激活提取,段延伸至黄金跟随者响应的结束。当波形不可用时,我们用0.1秒的静音替代,以保留预期的音频占位符数量。

#### 提示构建。对于多模态条件,用户输入包含音频项后跟相应的文本转录。转录上下文包含最近的n轮(当指定了上下文限制时),否则为完整的先前对话。音频+文本和仅文本条件分别存储和评估。自动行为分类器始终接收仅文本输入。

#### 说话人归一化。语料库特定的角色在生成提示中使用G:表示给予者角色,F:表示跟随者角色。对于自动分类,这些前缀被进一步匿名化:G: → A:, F: → B:。说话人前缀从被分类的最终响应中移除,减少数据集中和角色相关的线索。

## 附录D 控制器详情

冻结的语音对话LM每话轮池化 xt∈R^d 选择性SSM zt→ot 行为 ŷ_{t+1} 长度 L̂_{t+1} 方向选择、门控和强度校准 steer: v_m@ℓ_m⋆ + v_eot@ℓ_eot⋆ h_t 下一话轮

图4:控制器读取冻结骨干的残差流,并预测下一个对话行为和响应长度。预测的行为选择一个行为方向、其固定的引导强度以及实现感知门控;预测的长度被校准为话轮边界系数。所有决策依赖控制器的预测而非黄金标签在推理时。

#### 每话轮特征。对于每个对话话轮t,我们将控制器层ℓ_ctrl⋆的残差流激活在该话轮的token跨度上进行均值池化,并使用训练集统计进行标准化: xt = (φ(h_t^{ℓ_ctrl⋆}) − μ) ⊘ σ ∈ R^d, (9) 其中 φ 表示均值池化,(μ, σ) 是每个坐标的训练集均值和标准差,⊘ 表示逐元素除法。

#### 目标函数。对于每个保留的跟随者话轮t,话轮t-1后的因果状态预测其行为和响应长度的对数: L = Σ_{t ∈ I_train} (CE(W_o o_{t-1}, y_t) + λ smoothL1(w_L^T o_{t-1}, L_t)), (10) 其中 L_t = log(1 + words(u_t)),且 I_train 索引保留的跟随者话轮。

相似文章

ProactiveLLM: 学习主动交互的流式大语言模型

arXiv cs.CL

ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。

潜在智能体:一种内化多智能体辩论的后训练方法

Hacker News Top

波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。