提议以学习,学习以提议:在有限理性下的可评估性感知辅助

arXiv cs.AI 论文

摘要

本文提出了ProSE-Plan,一个贝叶斯自适应规划器,通过考虑用户在有限理性下的可评估性来改进AI辅助,使用提议作为探测来学习偏好并增强决策。

arXiv:2609.02242v1 Announce Type: new Abstract: AI助手通常通过提出候选编辑、计划或设计方案,由用户在采用前进行评估。现有的辅助方法侧重于提案质量或用户目标推断,通常假设用户能可靠地评估任何提案,但这在实践中可能因有限理性而失效。我们研究可评估性感知的提案规划,其中提案既作为任务干预,又作为探测以学习潜在偏好和评估约束,由此产生的信念更新随后指导后续提案。我们将此场景形式化为ProSE,一个隐藏参数的序列辅助问题,并用一个KL正则化的有限理性二元响应模型实例化,其中接受决策在价值增益与距离依赖的可评估性惩罚之间权衡。分析这种似然的规划后果表明,可能被接受的提案与信息丰富的探测不必重合,这解释了为什么仅追求接受的规划器系统性表现不佳。我们使用\textsc{ProSE-Plan}实现了ProSE,这是一个深度为2的贝叶斯自适应规划器,通过可能响应和响应诱导的后验信念来评分提案。在受控的图模拟中,当评估成本是瓶颈时,\textsc{ProSE-Plan}优于无视可评估性和近视的基线,并且一个探测-提交消融实验证实我们的方法选择了更简单方法遗漏的信息丰富的提案。因此,我们的结果将用户可评估性确定为AI辅助中与规划相关的维度,是对生成质量和偏好推断的补充。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:03

# 提议以学习,学习以提议:有限理性下的可评估性感知辅助  
来源:https://arxiv.org/html/2609.02242  
作者:Yifan Zhu  
所属机构:ELLIS Institute Finland  
所属机构:芬兰阿尔托大学计算机科学系  
邮箱:[[email protected]](mailto:)  
作者:Sammie Katt  
所属机构:ELLIS Institute Finland  
所属机构:芬兰阿尔托大学计算机科学系  
邮箱:[[email protected]](mailto:)  
作者:Samuel Kaski  
所属机构:ELLIS Institute Finland  
所属机构:芬兰阿尔托大学计算机科学系  
所属机构:英国曼彻斯特大学计算机科学系  
邮箱:[[email protected]](mailto:)  

#### 摘要  
AI助手常通过提议供用户评估采纳的候选编辑、计划或设计来实现协作。现有辅助方法聚焦于提案质量或用户目标推断,通常假设用户能可靠地评估任何提案,这在实际中因有限理性可能失效。我们研究可评估性感知的提案规划,其中提案既作为任务干预,也作为探测用户潜在偏好与评估约束的探针,由此产生的信念更新进而指导后续提案。我们将此场景形式化为ProSE——一个隐藏参数序列辅助问题,并用KL正则化的有限理性二元响应模型实例化,其中接受与否权衡了价值增益与距离相关的评估惩罚。分析该似然函数的规划含义揭示:高概率被接受的提案与信息丰富的探针未必重合,这解释了为何仅追求接受的规划器系统性表现不佳。我们用ProSE-Plan(一个深度-2的贝叶斯自适应规划器)实现ProSE框架,该规划器通过可能的响应及响应引发的后验信念对提案进行评分。在受控图模拟中,当评估成本成为瓶颈时,ProSE-Plan优于可评估性无感知和短视基线方法,探针-承诺消融实验证实我们的方法能选出更简单方法遗漏的信息性提案。因此,我们的结果将用户可评估性确定为AI辅助中与生成质量和偏好推断互补的规划相关维度。  

## 1 引言  
近年来,提案-评估范式在AI辅助决策中被广泛应用,助手提出提案,用户通过评估决定是否采纳。这在编码、写作和设计任务中很常见,此类辅助应通过提出可评估的下一状态而非自主行动来保留用户控制。此范式中的有效辅助不仅需要生成高质量提案。现有辅助主要建模用户需求,或如何在用户目标不确定下行动[1]、[2]、[3]、[4]、[5]。这解决了辅助的核心方面,但忽略了用户能否从当前状态评估特定提案。这很重要,因为人类决策受限于认知和计算约束[6]、[7]、[8]、[9]、[10]。大规模代码重构原则上可能改进代码库,但检查成本过高;而较小的补丁可能不是全局最优,但更易验证,因而可能有用。关于AI辅助编程的实证工作揭示,用户常常难以处理过于复杂的提案,过多的AI信息可能降低而非提高决策质量[11]、[12]。虽然先前工作已解决此问题的某些方面,如有限理性用户建模[3]、[4],偏好学习中的查询难度[13]、[14],以及显示时机[15](在附录A中进一步讨论),但可评估性如何塑造用户响应及助手能从中学到什么,在序列辅助中受到关注较少。  

我们将此问题形式化为基于提案的序列辅助(ProSE)。在ProSE中,每个提案具有双重角色:它是任务的候选干预,也是学习用户的观测探针。助手必须建模用户响应,既预测提案显示时会发生什么,也更新对用户潜在参数的信念。高价值提案可能因难以评估而被拒绝,而更温和的提案可能产生改进未来辅助的响应。因此,助手应推理可能的响应如何改变未来提案选择,而非仅最大化即时接受率。在ProSE内,我们实例化一个受信息论有限理性[16]、[17]启发的易处理二元响应模型。响应似然权衡了用户价值增益与距离相关的评估惩罚,因此同一提案可能因低价值或从当前状态评估成本过高而被拒绝。我们随后分析其结构特性及对提案规划的后果。该模型诱导出*接受前沿*作为响应决策边界,以及*信息前沿*,刻画哪些提案距离对用户的可评估参数具有信息量。我们的主要结果表明,关于可评估性的最具信息量的提案可能位于接受前沿的预期拒绝侧。因此,高概率被接受的提案与信息性提案未必重合:拒绝可成为未来辅助的有用证据,而非仅仅是失败的辅助。  

我们用ProSE-Plan实现该框架,这是一个深度-2的贝叶斯自适应规划器,通过可能的响应及响应引发的后验信念对提案进行评分。我们在两个受控图任务中评估它:一个用于端到端性能的分支走廊(当高价值提案难以评估时),以及一个探针-承诺任务(隔离依赖响应的信念更新)。结果显示,当评估成本成为瓶颈时,可评估性感知规划有所帮助,且预期响应能揭示关于用户的何种信息可导致更好的后续提案。我们的贡献在于:提出可评估性感知的提案规划框架,用有限理性响应模型和前沿分析实例化,并在受控模拟中验证了一个最小化的贝叶斯自适应规划器。这些结果共同将用户可评估性确定为AI辅助中与生成质量和偏好推断互补的规划相关维度。  

## 2 前提知识  
我们的工作利用两个重要概念:基于潜在模型不确定性的贝叶斯决策,以及信息论有限理性。本节简要介绍两者。  

**贝叶斯决策**。序列决策通常形式化为马尔可夫决策过程(MDP)$(S,A,T,R,\gamma)$,其中$S$是状态空间,$A$是动作空间,$T(s' \mid s,a): S \times A \to \Delta(S)$是转移动力学,$R(s,a,s'): S \times A \times S \to \mathbb{R}$是奖励函数,$\gamma \in [0,1]$是折扣因子。目标是找到最大化期望回报的策略$\pi: S \to \Delta(A)$:  
$\pi^\star \in \argmax_{\pi} \mathbb{E}_{\tau \sim (\pi, \mathcal{T})} \left[ \sum_{t=0}^{T-1} \gamma^t \mathcal{R}(s_t, a_t, s_{t+1}) \right]$,  
其中$a_t \sim \pi(\cdot \mid s_t)$,$s_{t+1} \sim \mathcal{T}(\cdot \mid s_t, a_t)$,$T$是规划视野[18]。在许多场景中,转移或奖励模型并非先验已知,常由潜在参数$z$参数化,并通过经验学习,这在现实应用中成本高昂。贝叶斯替代方法是假设先验$p_0(z)$,并维护基于交互历史$h_t = (s_0,a_0,...,a_{t-1},s_t)$的潜在参数信念$b_t(z) = p(z \mid h_t)$,使智能体能够针对世界演化信念做出最优决策。具体而言,观测到转移$(s_t, a_t, s_{t+1})$后,信念通过贝叶斯规则更新:  
$b_{t+1}(z) = p(z \mid h_t, a_t, s_{t+1}) \propto \mathcal{T}_z(s_{t+1} \mid s_t, a_t) b_t(z). \quad (1)$  
最优解则是基于此信念优化未来奖励的策略。贝叶斯自适应MDP(BA-MDP)通过在增广信念状态$(s,b)$中建模潜在模型不确定性下的规划来形式化此思想[19]。(BA-)MDP的典型解法计算并最大化Q值:在某个状态下采取动作的期望值,可通过贝尔曼方程递归计算,剩余$h$步前瞻:  
$Q_h^\star(s,b,a) = \int_z b(z) \sum_{s'} \mathcal{T}_z(s' \mid s,a) \left[ \mathcal{R}_z(s,a,s') + \gamma \max_{a' \in \mathcal{A}} Q_{h-1}^\star(s', b^{a,s'}, a') \right] dz, \quad (2)$  
其中$Q_0(\cdot)$通常定义为0,$b^{a,s'}(z)$是观测到$s'$后的后验信念。  

**信息论有限理性**。有限理性指智能体在内部认知和计算约束下运作,无法完全优化其决策[6]、[7]。计算理性视角将这种偏离完美理性的行为视为智能体在主观效用下充分利用其有限认知资源的结果[8]、[20]、[9]。特别是,信息论有限理性[16]、[17]将用户行为形式化为求解单次KL正则化决策问题,选择动作$a \in \mathcal{A}$的概率被描述为最大化效用$U: \mathcal{A} \to \mathbb{R}$与信息成本(偏离先验策略$q \in \Delta(\mathcal{A})$的形式)之间的权衡:  
$p^{\mathrm{ITBR}} = \argmax_{p \in \Delta(A)} \Big[ \sum_{a \in \mathcal{A}} p(a) U(a) - \frac{1}{\kappa} D_{\mathrm{KL}}(p \parallel q) \Big] \quad (3)$  
其中$\kappa > 0$是控制用户认知努力的逆温度参数。较大的$\kappa$表示用户投入更多努力偏离默认行为以追求更高效用,而$\kappa \to 0$则无论效用如何都恢复默认动作。由于当所有$a$的$q(a) > 0$时,公式(3)中的目标是$p$的严格凹函数,因此存在唯一闭式解(附录B.1或[17]了解详情)。求解单纯形约束优化给出吉布斯策略:  
$p^{\mathrm{ITBR}}(a) \propto q(a) \exp\big(\kappa U(a)\big). \quad (4)$  
公式(4)表明,最优动作是朝向更高效用动作倾斜的默认分布$q$,倾斜程度由$\kappa$控制。  

## 3 问题设置:基于提案的序列辅助  
我们研究一个序列设计任务族,用户迭代地将当前设计(状态)修订为满意的结果。在此交互范式中,助手提出候选下一状态或编辑,用户随后评估并响应(如接受或拒绝),实现的下一状态则由当前状态、提案和用户响应决定。助手的主要目标是通过提案帮助用户实现更好的最终工件,主要困难在于好的提案依赖于用户接受它们的可能性。如前所述,这种可能性不仅取决于其质量(即与用户偏好的契合度),还取决于用户能否(以及是否愿意)评估它。本节我们将此问题设置形式化为基于提案的序列辅助(ProSE)。  

**定义3.1(ProSE过程)**。ProSE过程包括任务状态空间$\mathcal{S}$、候选提案空间$\mathcal{C}$(其中$\mathcal{C}(s) \subseteq \mathcal{S}$)、用户响应空间$\mathcal{Y}$、潜在用户参数空间$\mathcal{Z} = \Phi \times \Theta$(先验$p_0$分别表征偏好$\Phi$和可评估性$\Theta$)、用户响应模型族$P(y \mid s, \tilde{s}, z): \mathcal{S} \times \mathcal{C}(s) \times \mathcal{Z} \to \Delta(\mathcal{Y})$、响应介导的转移动力学$\mathcal{T}^y(s' \mid s, \tilde{s}, y): \mathcal{S} \times \mathcal{C}(s) \times \mathcal{Y} \to \Delta(\mathcal{S})$,以及用户价值函数族$\mathcal{V}_{\Phi} = \{ V_\phi: \mathcal{S} \to \mathbb{R} \}_{\phi \in \Phi}$。在ProSE中,助手的动作空间是提案集合$\mathcal{C}(s)$,我们将其称为$\tilde{s}$(而非动作$a$)。在每个时间步,给定选定的提案$\tilde{s}$,用户根据$y \sim P(\cdot \mid s, \tilde{s}, z)$响应,任务状态根据$s' \sim \mathcal{T}^y(\cdot \mid s, \tilde{s}, y)$演化。在设计任务中,动力学通常在给定用户动作后是确定性的,我们用确定性转移函数$\mathcal{T}^y(s' \mid s, \tilde{s}, y)$编码。例如,用户的回复$y$可能是忽略提案并自己进行某些编辑以改变状态。ProSE是...

相似文章

SEER: 使用监督学习控制 Energetic Reasoning

arXiv cs.AI

本文研究使用监督学习构建一个预言机,用于决定何时在约束规划中应用计算昂贵的 Energetic Reasoning 传播器,展示了高预测准确性,并强调了关键的设计选择。