人机协作中的非均匀性原则

arXiv cs.AI 论文

摘要

本文介绍了在长AI工作流中最佳的人类监督位置安排的非均匀性原则,证明监督阶段应按非递减间隔安排。该原则在文献综述和网站构建任务中得到了实证验证。

arXiv:2607.16530v1 公告类型:新 摘要:随着生成式AI越来越多地被应用于自动化多步骤和高风险工作流,人类的判断和参与对于确保AI生成输出的质量仍然至关重要。在实践中,虽然人类专家定期对AI进行监督是可取的,通常通过审查中间输出、提供反馈、进行修正并指导后续步骤,但这种监督受到人类可投入的时间和资源的限制。这就在人类监督的需求与AI以更少干预提供更多输出的效率之间产生了张力。那么,一个重要但尚未充分探索的问题是如何优化人类在人机协作中的参与。这项工作最初源于我们的实证观察:在长AI工作流中,人类监督往往能提高用户满意度,同时减少不必要的返工和令牌消耗。由此,我们提出了在人机协作中如何安排监督阶段的问题。在合理的假设下,我们提出了非均匀性原则,该原则指出最优安排是在工作流中以非递减的间隔设置监督阶段。我们在两种常见的AI智能体工作流中实证验证了这一原则:撰写文献综述和构建网站。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:38

# 人机协作中的非均匀性原理

来源:https://arxiv.org/html/2607.16530

\setkeys Ginwidth=\Gin@nat@width,height=\Gin@nat@height,keepaspectratio\NAT@set@cites

An Luo and Jie Ding  
School of Statistics, University of Minnesota  
[email protected] and [email protected]

###### 摘要

随着生成式AI越来越多地被应用于自动化多步骤、高风险的流程,人工判断和参与对于确保AI生成输出的质量仍然至关重要。在实践中,虽然希望人类专家定期对AI进行监督(通常通过审查中间输出、提供反馈、进行修正和引导后续步骤),但这种监督受到人类能够投入的时间和资源的限制。这就造成了人类监督需求与AI以更少干预产生更多输出的效率之间的矛盾。因此,一个重要但尚未充分探索的问题是:如何在人机协作中最优地安排人类参与。这项工作最初源于我们的实证观察:在长程AI工作流程中,人工监督通常能提高用户满意度,同时减少不必要的返工和令牌消耗。在此基础上,我们提出了在人机协作中监督阶段应该放置在何处的问题。在合理的假设下,我们发展了非均匀性原理,该原理指出最优调度应以非递减的间隔安排监督阶段。我们通过在两种常见的AI智能体工作流程(撰写文献综述和构建网站)中的实验来实证验证了这一原理。

关键词:人机协作,AI审计,智能体AI,可扩展监督

## 1 引言

生成式AI正从基于大语言模型(LLMs)的单次生成(Wei et al.,2022;Ouyang et al.,2022;OpenAI et al.,2023;Gemini Team Google,2023)转向长时域工作流,例如解决现实世界中的软件工程问题(Jimenez et al.,2024)、浏览网页以完成用户指定的目标(He et al.,2024)、以及生成扩展的书面报告(Wang et al.,2024)。在这些长时域工作流中,AI需要跨多个步骤工作(Yao et al.,2023)、使用外部工具(Qin et al.,2024;Patil et al.,2024),并协调不同的操作(Hong et al.,2024;Wu et al.,2024)。然而,将人类监督保持在循环中仍然是至关重要的。例如,当AI用于自动化药物发现(Koscher et al.,2023;Abramson et al.,2024;DeMeo et al.,2025)时,人类专家仍需要在工作流程的多个阶段参与,例如细化生物学目标、评估提出的候选药物是否具有科学意义,以及决定哪些应进一步进行实验验证。当AI自动化实验室操作(Boiko et al.,2023;Szymanski et al.,2023;Dai et al.,2024)时,人类仍需要在多个阶段提供监督,例如指定实验约束、监控安全性,以及判断测量结果是否支持预期的主张。在实践中,虽然希望人类专家定期对AI进行监督以确保其输出质量,但这种监督受到人类能够投入的时间和资源的限制。这就造成了人类监督需求与AI以更少干预产生更多输出的效率之间的矛盾。因此,一个重要但尚未充分探索的问题是:如何在人机协作中最优地安排人类参与。

现有研究对此问题提供的指导有限。许多工作研究了人类应如何向AI系统提供反馈(Amershi et al.,2019;Ouyang et al.,2022),同时越来越多的文献探讨了在复杂的特定领域任务中人类参与的益处,包括医疗决策(Reverberi et al.,2022;Vaccaro et al.,2024;Wang et al.,2026)、科学写作(Gero et al.,2022;Liang et al.,2024;Thakkar et al.,2026)和数据科学(Meng,2023;Luo et al.,2025a,b,2026)。然而,关于在AI的长时域工作流程中,如何调度有限数量的人类监督阶段,目前所知甚少。

我们的研究源于实证观察:在长AI工作流中,人工监督通常能提高用户满意度,同时减少不必要的返工和令牌消耗。在此基础上,我们提出了在人机协作中监督阶段应放置于何处的问题。在合理的假设下,我们发展了*非均匀性原理*,该原理指出最优调度应以非递减的间隔安排监督阶段。图1(位于https://arxiv.org/html/2607.16530#S1.F1)给出了非均匀性原理的图示。

参见图注
图1:非均匀性原理的图示。(a) 具有相同监督阶段数的不同监督调度。绿色星形调度在开始阶段安排相对密集的监督,然后逐渐增大后续监督阶段的间隔,这符合非均匀性原理。黄色三角形调度使用均匀间隔,红色正方形调度使用递减间隔。(b) 这些调度的质量-成本权衡。此处成本代表人类监督成本。非均匀性原理下的调度在所有四种调度中是最优的。均匀间隔和递减间隔的调度需要更大的成本而没有提高质量。灰色圆形表示无监督,其成本最低但质量也最低。

我们首先形式化了人机协作问题:AI智能体逐步构建交付物,而人类关于交付物最终应满足的意图对智能体是隐藏的。智能体仅从初始上下文开始,必须在$T$个阶段内生成最终交付物。在选定的阶段,人类基于潜在的意图和智能体已产生的内容提供监督,智能体可以根据人类输入修正迄今产生的交付物。在这些阶段会产生人类监督成本。对于固定数量的$K$个监督阶段,目标是优化监督阶段的调度$S=\{s_1,\ldots,s_K\}$以平衡两种力量:智能体生成的最终交付物与人类意图之间的对齐质量,以及人类监督成本。基于我们的人机协作形式化,我们的理论关键是衡量两个连续监督阶段之间发生的情况。我们假设在人类提供监督后,智能体与人类意图的对齐更好。然后,当智能体自行工作更多阶段时,其对人类意图的不确定性可能会增加,因此,预期对齐误差被认为随着自上次监督以来的阶段数增加而增加。在合理的假设下,我们将证明原始的调度问题可以简化为一个更简单的形式,涉及$K$个监督阶段之间的调度。我们进一步发展了非均匀性原理:最优监督调度具有非递减的间隔。这里,间隔表示相邻人类监督之间的生产阶段数。由此产生的调度在早期更频繁地使用监督。直觉是,在早期阶段,人类监督可以快速缩小AI的长期搜索空间,以与人类未观察到的意图对齐。在过程的后期,监督变得更加昂贵,但对于继续完善工作以交付高质量的最终结果仍然是必要的。

我们通过在两种常见的长时域任务(撰写文献综述和构建HTML页面)上的实验,展示了非均匀性原理的实用价值。

本文的其余部分安排如下。第2节(https://arxiv.org/html/2607.16530#S2)形式化了人机协作问题。第3节(https://arxiv.org/html/2607.16530#S3)发展了非均匀性原理,并提供了寻找最优监督调度的实用指南。第4节(https://arxiv.org/html/2607.16530#S4)展示了实验结果,并检验了它们与理论的一致性。我们在第5节(https://arxiv.org/html/2607.16530#S5)总结本文。补充材料包括证明以及讨论和实验的细节。

## 2 人机协作的问题形式化

我们首先描述人机协作问题。人类心中有一个预期的交付物,但这种意图仅通过初始上下文部分地提供给AI智能体。从该初始上下文开始,智能体在$T$个顺序阶段内构建交付物,每次产生一个组件。在选定的阶段,人类审查迄今为止产生的部分交付物并提供监督。这种监督可以帮助修正先前生成的内容、澄清人类的意图、并指导智能体未来的生产。在这些监督阶段,智能体会修正工作中的交付物然后继续。最终交付物通过每个阶段级输出与人类意图所隐含的相应潜在需求的对齐程度来评估。每次监督也会产生人类监督成本,因为人类在给出反馈之前必须花费时间和精力检查当前的草稿。目标是调度固定数量的监督阶段,使得最终交付物具有高的对齐质量,同时人类监督成本保持较低。

人机协作形式化中主要概念的概览如图2所示(https://arxiv.org/html/2607.16530#S2.F2)。

参见图注
图2:人机协作中主要概念的概览。AI智能体从阶段$1$到阶段$T$顺序构建一个交付物。在调度$S=\{s_k\}_{k=1}^K$中的每个监督阶段$s_k$(其中$1 \leq s_1 < \cdots < s_K \leq T$),人类使用潜在的隐藏意图审查当前的部分交付物。基于人类的反馈,智能体修正交付物。目标是找到最优的调度$S$,以平衡最终交付物的对齐质量与人类监督成本。

### 2.1 序贯生成的形式化

设序列的长度为$T \in \mathbb{N}$。存在一个潜在的、隐藏的需求序列$Z_1,\ldots,Z_T \in \mathbb{R}^d$,它代表了在没有任何不一致或智能体错误的情况下,对阶段级输出的精确期望。这些隐藏的需求源自人类的意图,在智能体开始时是未知的,但在过程展开时会演化。形式上,令$(\Omega, \mathcal{F}, \mathbb{P})$为一个概率空间。考虑一个随机过程$\{Z_t\}_{t=1}^T$。由于这些需求对人类来说是已知的但对智能体是隐藏的,智能体必须基于初始上下文信息构建交付物。初始上下文信息由初始$\sigma$-域$\mathcal{H}_0 \subset \mathcal{F}$编码。每当人类提供监督时,会生成关于隐藏意图的信息。更具体地说,在监督阶段$s$,人类揭示足够多的信息,使得智能体了解$Z_1,\ldots,Z_s$(或至少能够完美预测它们)。我们将此信息状态表示为$\sigma$-域$\mathcal{H}_s$,其中$\mathcal{H}_0 \subseteq \mathcal{H}_1 \subseteq \cdots \subseteq \mathcal{H}_T \subseteq \mathcal{F}$。此外,我们假设信息是非递降的,因此$\mathcal{H}_0 \subseteq \mathcal{H}_s$对于所有$s \in S$成立。

对于每个阶段$t$,智能体在信息$\mathcal{H}_{\tau(t)}$下生成一个部分交付物$w_t^{-}$,其中$\tau(t)$是$t$之前的最近监督阶段(包括$0$表示初始上下文)。形式上,对于$t=1,\ldots,T$,令$\tau(t) = \max\{s \in S \cup \{0\}: s < t\}$。则$w_t^{-} = \mathbb{E}[Z_t \mid \mathcal{H}_{\tau(t)}]$。在收到部分交付物后,人类可能会提供反馈,允许智能体将交付物修正为$w_t$。最终交付物是序列$w_1,\ldots,w_T$。

### 2.2 对齐误差的形式化

部分交付物$w_t^{-}$和需求$Z_t$之间的对齐误差为$\|w_t^{-} - Z_t\|^2$。由于监督阶段后智能体可以修正其交付物,我们假设在监督阶段$s_k$,智能体可以完美地将之前的所有交付物与人类意图对齐。这意味着对于所有$t \leq s_k$,修正后的交付物$w_t$满足$w_t = Z_t$。因此,对于$t > \tau(t)$,我们感兴趣的是$\mathbb{E}[\|w_t^{-} - Z_t\|^2]$。总的预期对齐误差为所有阶段的期望平方误差之和:
\[
\mathcal{E}(S) = \sum_{t=1}^T \mathbb{E}[\|w_t^{-} - Z_t\|^2].
\]

### 2.3 人类监督成本的形式化

监督成本取决于监督阶段的位置。在阶段$s$,人类必须审查迄今为止生成的$s$个交付物$w_1,\ldots,w_s$。令$c(s)$为在阶段$s$提供一次监督的成本。则总监督成本为:
\[
\mathcal{C}(S) = \sum_{k=1}^K c(s_k).
\]
我们假设$c(s)$在$s$上是非递降的。这反映了这样一个事实:审查较长的草稿比审查较短的草稿更昂贵。

### 2.4 目标函数

对于给定的监督阶段数$K$,目标是找到调度$S$以最小化对齐误差和人类监督成本的组合:
\[
\min_{S: 1 \leq s_1 < \cdots < s_K \leq T} \mathcal{E}(S) + \mathcal{C}(S).
\]

## 3 非均匀性原理

在本节中,我们推导出最优监督调度的结构性质。我们从一个关键概念开始:间隔。

### 3.1 间隔和降维

对于调度$S$,定义间隔$d_0, \ldots, d_K$如下。令$s_0 = 0$。则对于$k = 0,\ldots,K-1$,$d_k = s_{k+1} - s_k$,且$d_K = T - s_K$。对于$k=0,\ldots,K-1$,间隔$d_k$是第$k$次监督和第$(k+1)$次监督之间的阶段数。最后一个间隔$d_K$是最后一次监督和总阶段数$T$之间的阶段数。注意$\sum_{k=0}^K d_k = T$。

我们将在以下假设下推导非均匀性原理。

**假设1**(马尔可夫潜在需求)。随机过程$\{Z_t\}_{t=1}^T$满足,对于任意$s \in S \cup \{0\}$和任意$r > 1$,$Z_{s+r}$在给定$\mathcal{H}_s$的条件下,与$(w_{s+1}^{-},\ldots,w_{s+r-1}^{-})$条件独立。

**假设1**将潜在需求过程与智能体的中间交付物解耦。也就是说,未来的需求$Z_{s+r}$仅依赖于阶段$s$时可用的信息,而不依赖于两者之间产生的草稿。

**引理1**。在假设1下,对于每个$s \in S \cup \{0\}$和每个满足$\tau(s+r)=s$的正整数$r$,有
\[
\mathbb{E}[\|w_{s+r}^{-} - Z_{s+r}\|^2] = \rho_s(r).
\]
**引理1**表明,智能体在阶段$s+r$的草稿的期望平方误差等于$\rho_s(r)$,即从阶段$s$看到的$Z_{s+r}$的条件方差。

**假设2**。存在一个函数$\rho(r) \geq 0$,使得对于任意$s \in S \cup \{0\}$和任意满足$\tau(s+r)=s$的整数$r \geq 1$,$\rho_s(r) = \rho(r)$成立。

**假设2**指出,在任何监督之后,滞后期$r$的期望预测误差仅取决于$r$,而不取决于监督发生在哪个阶段。结合引理1和假设2,我们得到$\mathbb{E}[\|w_{s+r}^{-} - Z_{s+r}\|^2] = \rho_s(r) = \rho(r)$。令$s_0:=0$,我们对最终交付物施加以下假设。

**假设3**。存在一个常数$\kappa \in (0,1)$,使得对于每个$k=0,\ldots,K-1$和每个满足$s_k < t \leq s_{k+1}$的整数$t$,修正后的最终交付物$w_t$满足$\mathbb{E}[\|w_t - Z_t\|^2] = \kappa \rho(t - s_k)$。

**假设3**指出,在监督阶段$s_{k+1}$之后,人类反馈可以将对齐误差减少到原始预期误差的$\kappa$倍。这反映了人类监督的改进效果,但不是完美的。

在这些假设下,总预期对齐误差可以表示为间隔的函数。我们得到以下引理。

**引理2**。在假设1、2和3下,总预期对齐误差为:
\[
\mathcal{E}(S) = \sum_{k=0}^{K-1} \Phi(d_k) + \Psi(d_K), \quad \text{其中} \quad \Phi(d) = \kappa \sum_{r=1}^d \rho(r), \quad \Psi(d) = \sum_{r=1}^d \rho(r).
\]
**证明**。从第3.1节到第3.2节省略。

现在,目标函数简化为:
\[
\min_{d_0,\ldots,d_K \geq 0, \sum_{k=0}^K d_k = T} \left\{ \sum_{k=0}^{K-1} \Phi(d_k) + \Psi(d_K) + \sum_{k=1}^K c(s_k) \right\}.
\tag{9}
\]
其中$s_k = \sum_{j=0}^{k-1} d_j$。

我们还可以推导出$\Phi$和$\Psi$的关系。由于$\kappa \in (0,1)$,对于所有$d \geq 1$,有$\Phi(d) < \Psi(d)$。此外,$\Phi$和$\Psi$都是递增函数,因为$\rho(r) \geq 0$。

### 3.2 非均匀性原理

我们现在推导最优调度方案的结构。

**定理1**(非均匀性原理)。在假设1-3下,存在一个最优调度$d_0^\star,\ldots,d_K^\star$满足$d_0^\star \leq d_1^\star \leq \cdots \leq d_{K-1}^\star$。

**定理1**指出,最优间隔是非递减的。这意味着监督应更频繁地安排在早期阶段,然后间隔逐渐增大。

**定理2**(早期集中调度)。在假设1-4下,如果对于所有$1 \leq s \leq T-1$,成本增量满足$\min_{1 \leq s \leq T-1} \{c(s+1)-c(s)\} > \rho(T-K) - \kappa \rho(2)$,则$d_0^\star = \cdots = d_{K-1}^\star = 1$且$d_K^\star = T-K$。

**定理2**指出,如果监督成本增长很快,最优调度是将所有$K$个监督阶段放在前$K$个阶段。这意味着当人类提供监督的成本太高时,监督阶段应尽可能早地设置。

**推论2.1**。假设在目标函数(9)中$c(s) = \lambda s$且$\lambda > 0$。在假设4下,如果$\lambda > \rho(T-K) - \kappa \rho(2)$,则$d_0^\star = \cdots = d_{K-1}^\star = 1$且$d_K^\star = T-K$。

### 3.3 寻找最优调度的实用指南

为了给出寻找最优调度的精确算法作为实用指南,这里我们取$c(s) = \lambda s$,其中$\lambda > 0$是一个常数,代表人类审查的成本。这个选择合理地假设审查具有$s$个单元的交付物需要与内容量成比例的努力。由于$s_k = \sum_{j=0}^{k-1} d_j$,我们有:
\[
\sum_{k=1}^K c(s_k) = \lambda \sum_{k=1}^K s_k = \lambda \sum_{k=1}^K \sum_{j=0}^{k-1} d_j = \lambda \sum_{j=0}^{K-1} (K-j) d_j.
\tag{10}
\]

为了给出一个实践上简单的算法,这里我们假设$Z_t$按照**注1**中描述的随机游走模型演化。这给出了$\rho(r) = \sigma^2 r$,因此:
\[
\Phi(d) = \frac{\kappa \sigma^2}{2} d(d+1) \quad \text{and} \quad \Psi(d) = \frac{\sigma^2}{2} d(d+1).
\tag{11}
\]

根据目标函数(9),在随机游走模型下使用线性监督成本$c(s) = \lambda s$,精确的调度目标由下式给出(结合(9)、(10)和(11)):
\[
J_\lambda(d_0,\ldots,d_K) = \sum_{j=0}^{K-1} \left\{ \frac{\kappa \sigma^2}{2} d_j(d_j+1) + \lambda (K-j) d_j \right\} + \frac{\sigma^2}{2} d_K(d_K+1).
\]

相似文章

(Human) Attention Is (Still) All You Need: 人类监督使AI辅助的社会科学研究可靠

arXiv cs.AI

本文提出,AI辅助社会科学研究的可靠性取决于决策架构——即认知劳动在人类与机器之间的分工方式。通过一个预先指定的析因实验,作者表明,一个无约束的多智能体基线在72%的运行中失败,而采用三个架构承诺(限制LLM仅进行推理、确定性数据/估计、以及三个人类决策门控)的组织运行失败率仅为16%。

不确定性下的人机互补稳健性

arXiv cs.LG

本文研究了对AI预测质量的不确定性如何影响人类决策者从互补信息中获益的能力,发现人类与AI预测之间的负误差相关能够实现稳健的改进策略。