交互式任务对齐作为POMDP

arXiv cs.AI 论文

摘要

本文介绍了一个在模糊情境下进行交互式任务对齐的框架,并将其形式化为POMDP。研究表明,当前的大语言模型仅在22%到32%的情况下能恢复用户预期任务,落后于人类表现。

arXiv:2607.16412v1 公告类型:新 摘要:当前语言模型的基准测试主要评估其在完全明确任务下的执行能力。然而,真实用户任务往往具有模糊性。用户带着不完整、探索性甚至矛盾的目标而来,这要求助手在执行任务前首先确定用户意图。我们将这一问题作为任务对齐来研究:即与用户就其预期任务达成一致的能力。我们引入了一个通用框架,将明确任务转化为模糊交互,并将其形式化为POMDP,其中模型必须从部分且不断演变的用户意图中推断出潜在任务。我们通过事后人类用户研究验证了我们的用户模拟器。在购物、编程和专业工作场景中,我们发现尽管模型在任务明确后通常表现良好,但它们在任务对齐上仍有困难:当前模型过早行动、交互效率低下,且无法解决模糊请求。在模糊条件下,模型平均仅能在22%到32%的情况下恢复用户的预期任务。在同一场景的人类研究中,人类的表现达到48%,优于所有评估模型。我们表明,通过监督微调和强化学习进行后训练可以提高任务对齐能力,但模型在通过交互解决不确定性方面仍落后于人类。综合来看,我们的结果表明,当前模型仍缺乏实现可靠代理所需的关键交互能力。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:38

## 1 引言

大型语言模型(LLMs)的评估主要基于完全指定的任务。模型被赋予一个目标、约束条件和成功标准,然后评估其能否执行该任务 (Yao et al., 2023), (Wei et al., 2025), (Jimenez et al., 2024)。这种完全指定的设置有助于分离*任务能力*。例如,要衡量模型编写准确代码的能力,必须完全指定编码问题及其测试,这样性能才能反映模型实际的代码编写能力,而非其理解请求的能力 (Jimenez et al., 2024)。然而,在实际部署中,用户几乎从不以完整规范开始。人类通常表达的目标是不完整的、探索性的、模糊的,甚至随时间前后矛盾。因此,瓶颈从*执行已知任务*转变为*确定用户实际意图的任务*。

最近的工作已开始认识到完全指定评估与现实使用之间的这种差异。例如软件工程任务上的 Ambig-SWE (Vijayvargiya et al., 2026) 和经济价值高的现实世界任务上的 GDPval (Patwardhan et al., 2025)。这些基准测试是朝着在任务模糊情况下进行现实评估的重要步骤,但它们通常衡量的是存在未明确指定情况下的端到端任务完成度。这使得很难区分任务执行的失败和任务理解的失败。在本文中,我们将两者解耦,研究模型实现任务对齐²²²任务对齐:代理通过相互建模来建立和维护共享任务理解的过程 Clark & Brennan (1991) 与用户(图 1)的能力。我们认为任务对齐是下游任务完成的前提:即使能力很强的模型,如果未能检测到缺失信息、假设用户意图并过早行动,也会失败。

参见图注

图 1:不确定性下的任务对齐。用户提供可观察的指令,而他们的真实需求则是潜在的。我们研究任务对齐阶段:在执行任务之前通过交互识别预期任务。尽管任务执行可能涉及额外的潜在环境状态,但这些下游执行动态不在讨论范围内。

为此,我们提出一个领域通用的框架,将完全指定的任务评估转化为具有未明确指定用户交互的任务对齐评估。给定一个具有任务空间和规范的领域,我们构建一个交互式设置,其中真实任务规范是潜在的,通过用户模拟器部分揭示,并逐步从抽象演变为完全指定。我们将此设置形式化为一个*部分可观测马尔可夫决策过程*(POMDP),其中助手仅观察对话历史,必须与用户交互,更新其对可能任务的信念,并决定何时承诺执行任务。这种形式化将任务发现与任务执行分离,使得该框架适用于任何单一领域。我们采用交互过程的*行为*和*信息论*指标来评估模糊性下的任务对齐,沿以下两个互补维度:(1)*任务恢复*衡量模型是否识别出预期任务;(2)*不确定性解决*衡量模型是否适当地检测到模糊性,寻求信息性澄清,并通过交互减少不确定性。

我们对跨真实世界购物、编码和专业工作任务的最新 LLM 进行了详细评估。我们的分析表明,当前模型在与用户对齐其任务方面存在困难,对于未明确指定的用户,平均只有 22-32% 的时间能恢复正确任务。在完全指定下表现良好的模型往往过早行动,在 1-3 轮对话中承诺执行任务;交互效率低下,未能澄清任务;或者对用户的预期任务仍然不确定。我们的结果表明,当前 LLM 仍缺乏可靠代理所需的关键沟通行为。本文的主要贡献包括:(1)我们提出了一个形式化为 POMDP 的框架,用于衡量模型如何与用户对齐任何可指定的任务,并通过人类研究验证该框架,表明模拟用户能引发与人类可比的规范行为;(2)我们发现当前模型即使在能够执行任务时,也难以确定用户的任务,并且任务对齐是模型行为的一个可分离的、领域通用的维度;(3)我们证明人类在识别未明确指定用户的任务方面超过了所有评估的模型;(4)我们展示了对 Qwen3.5 9B 进行 SFT 和 RL 的后训练能改善任务对齐,但模型仍落后于人类表现。

## 2 问题形式化

### 2.1 POMDP 框架

参见图注

图 2:我们基于 POMDP 的任务对齐框架工作流,以 Terminal-Bench 中的示例说明。助手与用户模拟器交互,用户模拟器的响应由演变的意图状态引导,该状态取决于完整规范和对话历史。在每一轮,助手对候选规范进行排序(仅用于评估的额外输出),从而允许我们追踪交互如何影响对潜在任务的信念。

给定一个任务设置 \(T\),令 \(\mathcal{X}_{T}\) 为由 \(T\) 诱导的所有可能任务规范的集合。例如,在购物设置中,任务规范可以是购买特定的亚马逊产品(“购买 Bose QuietComfort 蓝牙耳机”);在编码中,可以是问题陈述(“Build POV-Ray 2.2. Find and download the source...”)(Merrill et al., 2026)。我们从助手角度将*任务对齐*形式化为一个部分可观测马尔可夫决策过程(POMDP)\(\mathcal{M}_T = \langle \mathcal{S}, \mathcal{A}, \mathcal{T}, R, \Omega, \mathcal{O} \rangle\),如下所示。

#### 状态 \(\mathcal{S}\) 和观测 \(\Omega\)
在时间步 \(t\),环境状态为 \(s_t = (x^*, i_t, h_t) \in \mathcal{S}\),其中 \(x^* \in \mathcal{X}_T\) 是固定的真实规范,\(i_t \in \mathcal{I}\) 是用户当前的意图状态,\(h_t = (m_1^u, m_1^a, \ldots, m_{t-1}^u, m_{t-1}^a)\) 是助手承诺执行并终止对话之前的对话历史。意图状态捕捉了用户目标的哪些方面已被揭示、细化或保持隐含。助手仅观察对话历史,因此 \(\Omega\) 是可能对话的空间,且观测函数是确定性的 (\(o_t = h_t\))。\(x^*\) 和 \(i_t\) 都对助手隐藏,因此必须通过交互进行推断。

#### 动作 \(\mathcal{A}\)
在每一轮,助手采取动作 \(a_t = (m_t^a, e_t, \rho_t) \in \mathcal{A}\),其中 \(m_t^a\) 是附加到 \(h_t\) 的自然语言响应(例如,澄清性问题),\(e_t \in \{0, 1\}\) 是从 \(m_t^a\) 解析出的停止信号,表示承诺执行任务,该信号将终止对话。第三个分量 \(\rho_t\) 是对有限候选集 \(\mathcal{C} \subseteq \mathcal{X}_T\)(其中 \(x^* \in \mathcal{C}\))的排序,我们在每次对话后在*单独的对话线程*中根据当前对话历史进行诱导。\(\rho_t\) 严格是一种测量工具:它暴露了助手当前对预期任务的假设,而不将候选泄漏到对话中。

#### 转移 \(\mathcal{T}\)
真实规范 \(x^\star\) 在整个片段中固定不变;只有 \(h_t\) 和 \(i_t\) 演变。如果 \(e_t = 1\),则片段终止。否则,用户模拟器生成响应 \(m_t^u \sim \pi_u(\cdot \mid i_t, h_t, m_t^a)\),并演变意图状态 \(i_{t+1} \sim E(\cdot \mid x^\star, i_t, h_t, m_t^a, m_t^u)\),其中用户策略 \(\pi_u\) 和意图演化器 \(E\) 都使用 LLM 实现。因此,用户模拟器在 rollout 过程中定义了 \(\mathcal{T}\):它享有对 \(x^\star\) 的特权访问,并仅通过对助手动作的响应来揭示关于 \(x^\star\) 的信息。任务对齐评估一个助手策略 \(\pi_a(a_t \mid h_t)\)(将观察到的对话历史映射到动作分布)能否利用交互将其假设集中在 \(x^*\) 上,同时避免在不确定性下过早承诺。

### 2.2 评估指标

我们设计了指标,用于(1)评估 LLM 助手是否能恢复潜在的任务(任务恢复),以及(2)衡量其在承诺之前如何利用交互来减少不确定性(不确定性解决)。在每一轮之后,助手提供对候选集 \(\mathcal{C}\) 的排序 \(\rho_t\),这使我们能够追踪真实规范 \(x^\star\) 如何在随时间的助手的假设中移动。我们旨在分析准确性与不确定性的复合效应(图 4)。

#### 任务恢复行为
第一个问题是助手在承诺执行时是否已恢复预期任务。令 \(T^*\) 表示终止轮次。我们报告 CommitAcc@1 = \(\mathbb{1}\!\left[\mathrm{rank}_{\rho_{T^*}}(x^*)=1\right]\);归一化排序 CommitRank = \(\hat{r}_t = 1 - \frac{\mathrm{rank}_{\rho_t}(x^*) - 1}{|\mathcal{C}| - 1} \in [0,1]\),重点关注 \(\hat{r}_1\) 和 \(\hat{r}_{T^*}\);以及 CommitReward = \(\alpha \hat{r}_{T^*} - \lambda T^*\) 其中 \(\alpha = 1.5\) 且 \(\lambda = 0.02\),我们在第 3 节中将其作为训练信号(在不同超参数下)。结合 \(\mathbb{E}[T^*]\),这些指标捕捉了承诺时的质量-成本权衡:一个对齐良好的助手应能识别正确规范,同时避免不必要的交互。

#### 不确定性解决
仅凭排序行为并不能揭示助手是否有效利用了对话。当助手在提供 \(\rho_t\) 的同时输出对 \(\mathcal{C}\) 的置信度分数时,我们将归一化分数向量视为对候选的经验信念。细节见附录 C;不确定性指标仅针对输出置信度分数的模型子集报告。令 \(\tilde{H}_t(\pi_a) \in [0,1]\) 表示其在第 \(t\) 轮的归一化熵。我们通过累积信息增益来总结助手在整个片段中解决了多少不确定性:\(\boldsymbol{\mathrm{TotalIG}}(\pi_a) = \tilde{H}_0(\pi_a) - \tilde{H}_{T^*}(\pi_a)\)。这些数值区分了仅仅是猜对的助手与通过有用交互系统地缩小合理任务空间的助手。将承诺时的正确性与确定性交叉,得到四种结果(表 1),我们用来区分*诚实不确定*的助手和*自信但错误*的助手。

表 1:在助手承诺轮次 \(T^*\) 时,每个片段对齐结果的四象限分类。高/低 \(\tilde{H}_{T^*}\) 按所有 rollout 中的中位数划分。

### 2.3 任务设置

我们的框架包含三个任务:
- **Shopping-MMLU** (Jin et al., 2024):在一页产品中购买指定产品;
- **GDPVal** (Patwardhan et al., 2025):生产满足评分标准的真实世界可交付成果;
- **Terminal-Bench** (Merrill et al., 2026):编写代码、修改文件或执行命令以通过验证器。

将一个领域转换为任务对齐评估只需要其真实任务规范 \(x^*\):从每个 \(x^*\) 我们推导出初始用户意图 \(i_0\)、一个意图演化器 \(E: (h_t, i_t, x^*) \mapsto i_{t+1}\)(具有对 \(x^*\) 的特权访问),以及一个候选集 \(\mathcal{C}\),其中 \(|\mathcal{C}| = 15\) 且 \(x^* \in \mathcal{C}\)。相同的配方适用于任何具有可指定任务的基准测试。

#### 初始化意图状态
我们通过将 \(i_0\) 初始化为不同的抽象级别来引入未明确指定。对于每个任务,一个 LM 将 \(x^*\) 重写为三个从用户角度出发的意图层级,从*抽象*(“我需要一些东西让他忙起来”)经过*中等*(“我想要一个能吸引他注意力的有趣玩具”)到*具体*(“我在为喜欢大型工程车、容易对安静玩具感到无聊的小孩子找一些令人兴奋的东西”)³³³真实规范是“购买一个适合 3 岁以上儿童的、带电动万向轮的工程挖掘机玩具卡车”。生成的 \(i_0\) 为

相似文章

涌现对齐

arXiv cs.AI

本文介绍了涌现对齐(Emergent Alignment)这一自监督方法,该方法为大型语言模型(LLMs)赋予一个“良心”步骤,用于审查自身输出,并利用直接偏好优化(DPO)引导模型远离非伦理行为,从而实现在无需外部评判者的情况下进行在线对齐。