AI代理的战略决策支持

arXiv cs.AI 论文

摘要

本文提出了一个针对AI代理的战略决策支持框架,通过构建一个优化问题来最小化支持使用量,同时控制遗漏支持错误。作者开发了一种在线算法和校准方法,并在信息收集、人机协作和工具使用等多个场景中展示了其有效性。

arXiv:2606.12587v1 公告类型:新 摘要:传统上,决策支持研究人类如何利用机器学习模型做出更好的决策。在现代代理系统中,这种角色分工正在逆转:AI代理代表用户行动,而人类和工具则成为围绕它们的支持机制。这种角色反转将可靠性问题推到了前沿,因为代理错误可能造成严重后果,且代理行为必须始终保持与人类目标和约束一致。我们脱离经典的决策支持观点,在以AI代理为核心主体的设定下,重新审视其两个基本原则:寻求支持的成本-价值权衡以及不确定性量化的作用。我们提出了一个针对AI代理的战略决策支持框架,通过求解一个优化问题来最小化支持使用量,同时控制反事实遗漏支持错误:即代理在那些支持本可实质改善其输出的实例上单独行动的概率。在总体层面,我们证明最优策略是一个基于支持价值的阈值规则。基于这一结构,我们开发了一个在线算法,自适应地对这样的分数进行阈值化,并通过随机探索来控制遗漏支持错误,无需分布假设。我们进一步引入了一种即时校准方法,可在线减少不必要的支持调用。我们在多种场景中实例化该框架,包括信息收集、人机协作和工具使用,展示了如何通过相同的战略决策支持视角建模每种场景。跨这些场景的实验表明,我们的方法能够可靠地控制目标错误,同时在实际中大幅减少支持使用。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:52

# AI代理的战略决策支持 来源:https://arxiv.org/html/2606.12587 Shayan Kiyani、Sima Noorani¹ ¹宾夕法尼亚大学 宾夕法尼亚大学 [email protected] [email protected] George Pappas、Hamed Hassani 宾夕法尼亚大学 宾夕法尼亚大学 [email protected] [email protected] ###### 摘要 传统上,决策支持研究人类如何利用机器学习模型做出更好的决策。在现代智能体系统中,这种角色分工正日益反转:AI代理代表用户行动,而人类和工具则成为围绕它们的支持机制。这种角色反转将可靠性问题推到了前台,因为代理的错误可能带来严重后果,且代理行为必须始终与人类目标和约束保持一致。不同于经典的决策支持观点,我们在AI代理作为核心行动者的设定下,重新审视了其两个基本原则:寻求支持的成本-价值权衡,以及不确定性量化的作用。我们提出了一个AI代理**战略决策支持**框架,通过一个优化问题来实现:在控制反事实的错失支持错误(即代理在支持本可实质性改善其输出的情况下单独行动的概率)的同时,最小化支持的使用。在总体层面,我们证明了最优策略是基于**支持价值**的阈值规则。在此结构基础上,我们开发了一种在线算法,该算法自适应地对此类分数进行阈值化,并利用随机探索在不依赖分布假设的情况下控制错失支持错误。我们进一步引入了一种即时校准方法,可在在线过程中减少不必要的支持调用。我们将此框架实例化于多种场景,包括信息收集、人机协作和工具使用,展示了如何通过同一战略决策支持视角来建模每一种场景。跨这些场景的实验表明,我们的方法能可靠地控制目标错误,同时在实际中大幅减少支持的使用。 ## 1 引言 决策支持长期以来在人类决策者借助机器学习模型提供预测指导的设定中得到研究。在此类系统中,模型作为支持工具,而人类仍是最终行动者。然而如今,现代AI系统(如大型语言模型)正越来越多地以不同的角色被部署:作为自主代理,必须在复杂且不确定的环境中代表用户行动。其结果是,人类、特定领域的工具以及辅助信息来源本身,成为了围绕AI代理的支持机制。 这种角色转变将可靠性问题推到了前台。随着AI代理执行操作,它们的错误变得更具后果性:它们可能执行覆盖关键记录的代码、触发错误转账的金融交易,或推荐可能对患者造成伤害的医疗行动。同时,随着用户将更多决策委托给AI系统,确保代理行为与人类目标和约束保持一致变得至关重要。这些挑战要求我们重新思考决策支持的一个基本问题:*AI代理何时应单独行动,何时必须寻求支持以避免严重后果的失误或与下游意图的偏离?* 解决这个问题需要重新审视决策支持系统所依据的两个原则。 **成本-价值权衡。** 在经典观点中,支持系统(通常是ML模型)调用成本相对较低但并非完美,因为其预测容易出错。在代理设定中,角色的反转形成了一种不同的均衡:*寻求支持的成本往往很高*(例如,需要人力投入或额外的计算和延迟),但可能*可靠且对避免决策错误以及使代理与人类意图保持一致至关重要*。 **不确定性量化。** 任何采取行动的AI代理的核心都涉及不确定性量化。对于决策支持而言,正确的视角是量化*昂贵的支持在多大程度上可能显著改善代理的输出*。因此,不确定性是代理*和*支持机制的联合属性。这与常见的观点不同,后者仅通过代理本身来界定不确定性:代理对其行动是否有信心,或者环境和任务是否被充分理解。 见图注 图1:战略决策支持监督的效果。上:在没有监督的情况下,代理自信地将阿尔茨海默病病例误诊为健康,并未寻求可用的支持,导致错失支持错误。下:在监督下,触发了支持,代理咨询临床医生以收集额外的互动测试,从而能够恢复正确的诊断。 为此,我们提出一个将*支持的价值*与其成本分离,并将寻求支持视为战略决策的公式。支持的价值衡量了得到支持的输出是否优于代理单独产生的输出。核心错误因此是*错失支持*,即当支持本可改善输出时,代理却单独行动的情况。这个错误是反事实的,因为只有当支持被实际调用时,我们才能得知支持是否有帮助。因此,战略决策支持变成一个优化问题:尽可能少地使用支持,同时控制错失支持错误。我们总结如下贡献。图1(https://arxiv.org/html/2606.12587#S1.F1)展示了错失支持错误(上)以及通过战略决策支持监督纠正后的情况(下)。 #### 1. 战略决策支持框架。 在第3节(https://arxiv.org/html/2606.12587#S3)中,我们引入了SDS-Opt(https://arxiv.org/html/2606.12587#S3.Ex5),这是一个优化问题,旨在控制错失支持错误的同时最小化支持调用的比率。该公式建立在*支持的价值*之上:即得到支持的输出是否在实质上优于代理单独产生的输出。在总体层面,我们证明了最优策略具有基于支持价值的简单阈值形式。 #### 2. 具有无分布假设错误控制的在线算法。 在第4节(https://arxiv.org/html/2606.12587#S4)中,我们在此结构基础上开发了一种在线算法,该算法自适应地对此类分数进行阈值化,并利用随机探索在不依赖分布假设的情况下控制反事实的错失支持错误。我们进一步引入了一种即时校准方法,该方法随时间推移改进分数,在减少不必要支持调用的同时,保持阈值化保证的有效性。 #### 3. 应用与实证验证。 我们的框架还为设计围绕AI代理的支持提供了一种通用语言。我们通过四个代表性类别来实例化这一视角,这些类别在整篇论文中作为贯穿示例: - •示例1:信息收集。代理必须根据不完整信息行动,而额外的证据可以以一定成本改善其输出。支持可能包括后续问题、额外证据或专家提供的细节。例如,一个医疗助手可能根据初始症状描述进行推理,但进一步的病史、检查结果或实验室结果可能会实质性地改变其建议。 - •示例2:人在环中的规划。代理具备通用任务知识,但缺乏制定合适计划所需的局部背景。支持可能包括用户偏好、特定环境的约束或物体位置。例如,一个家用机器人知道如何一般性地打扫房间,但可能需要住户输入哪些物品是易碎的、哪些区域要避开、或在打扫前应移动什么。 - •示例3:人机协作推理。代理可以自行尝试解决问题,但可能对某个特定的推理步骤感到不确定。支持可能包括检查方法、识别错误或建议相关技术。例如,一个数学解题代理可能在推理看起来不可靠时,请人类验证一个关键计算或指出论证在何处失效。 - •示例4:工具使用。代理面临的任务需要外部工具提供可靠的信息或计算,而这些它可能无法自行正确完成。支持可能包括执行代码、查询数据库或搜索网络。例如,一个回答关于表格问题的代理可能调用SQL引擎,而不是仅依赖其内部推理。 在第5节(https://arxiv.org/html/2606.12587#S5)中,我们在真实世界数据集和LLM代理[^1]上实例化了这些类别,表明我们的方法在所有四个类别中都能控制错失支持错误,同时大幅减少不必要的支持调用;图2(https://arxiv.org/html/2606.12587#S1.F2)预览了我们在每个应用的一个模型上的结果,完整的实证研究在第5节(https://arxiv.org/html/2606.12587#S5)中给出。

[^1]: 代码公开可见于https://github.com/nooranisima/strategic-decision-support。

见图注
图2:我们的方法比由LLM自行决定的基线调用决策支持的频率低得多,同时保持了相当的错误率。对于四个代理应用:信息收集(DDXPlus)、工具使用(WikiSQL)、人在环中规划(VirtualHome)和协作人机推理(MATH),均使用Gemini-2.5-Flash,我们报告了两对柱状图。左边一对(实心)显示了累积的**支持率**:代理请求外部支持的输入比例。右边一对(斜线)显示了累积的**错失支持错误率*:支持本可实质性改善输出但未请求的情况。在每一对中,左柱是LLM基线(代理自行决定何时寻求支持),右柱是我们最佳的学习方法。在所有四个应用中,我们的方法调用支持的频率远低于基线,同时保持可比或更低的错误率。

## 2 相关工作

这里我们简要讨论密切相关的工作,更详细的讨论推迟到附录7(https://arxiv.org/html/2606.12587#S7)。

**训练代理寻求支持。** 一类工作通过训练将寻求支持的行为内化到代理自身中,包括在工具使用和检索方面[70(https://arxiv.org/html/2606.12587#bib.bib70)、5(https://arxiv.org/html/2606.12587#bib.bib5)、33(https://arxiv.org/html/2606.12587#bib.bib33)、32(https://arxiv.org/html/2606.12587#bib.bib32)、28(https://arxiv.org/html/2606.12587#bib.bib28)、61(https://arxiv.org/html/2606.12587#bib.bib61)]以及在用户交互方面[42(https://arxiv.org/html/2606.12587#bib.bib42)、91(https://arxiv.org/html/2606.12587#bib.bib91)、2(https://arxiv.org/html/2606.12587#bib.bib2)、85(https://arxiv.org/html/2606.12587#bib.bib85)]。这些方法产生了更强的代理:一个已经知道何时调用SQL的模型,或者经过微调以提出正确澄清问题的模型,正是我们框架所叠加的基础策略类型。我们的实验使用了前沿模型,这些模型已经融合了大量的此类训练,我们的增益反映出在已经擅长底层支持模态的代理之上,作为监督层所能实现的效果。

**推理时的支持寻求策略。** 一个密切相关的方向是设计推理时的策略,决定代理是否应在行动前暂停以寻求信息。一些策略对代理自身对其答案的置信度进行阈值化[39(https://arxiv.org/html/2606.12587#bib.bib39)、85(https://arxiv.org/html/2606.12587#bib.bib85)、68(https://arxiv.org/html/2606.12587#bib.bib68)];另一些则计算在明确成本下提问澄清的期望效用[19(https://arxiv.org/html/2606.12587#bib.bib19)];还有一些使用离线校准的、覆盖候选用户意图的预测集来触发求助[67(https://arxiv.org/html/2606.12587#bib.bib67)]。一个互补的研究方向考虑为*验证*(而非生成)而寻求支持[36(https://arxiv.org/html/2606.12587#bib.bib36)]。我们则提供了一个统一的框架,通过一个具有严格有限样本错误控制的监督层,将这些方法归入相同设计原则之下。这使我们能够在一个单一算法内处理广泛的支持模态,完全在线运行,并在用户选择的水平上控制反事实的错失支持错误,这一点我们将在实验中,跨信息收集、工具使用和人机协作进行测试。

## 3 战略决策支持的基本原理

在本节中,我们介绍战略决策支持在总体层面的核心目标。然后,我们刻画此框架下的最优支持寻求策略。这些结果为第4节(https://arxiv.org/html/2606.12587#S4)中开发的实际顺序算法奠定了基础,在该算法中,总体量未知,支持决策必须在线进行。

我们从建模AI代理与决策支持机制之间的交互开始。设 \(X \sim P_X\) 表示决策时代理可用的所有信息,包括用户提示、任务描述以及任何其他可用的输入模态。给定 \(X=x\),代理首先可以产生一个未受支持的输出 \(Y_0 \sim \pi(\cdot \mid x, \texttt{"no support"})\),对应于其独自生成的响应。在观察到这个初始输出后,代理必须决定是接受它还是寻求支持。³ 因此,支持寻求策略是一个函数 \(a: \mathcal{X} \times \mathcal{Y} \to \{0,1\}\),其中 \(a(x, y_0)=0\) 表示代理自行行动并保留未受支持的输出,而 \(a(x, y_0)=1\) 表示它寻求支持并产生一个受支持的输出 \(Y_1 \sim \pi(\cdot \mid x, y_0, \texttt{"with support"})\)。例如,在示例1(https://arxiv.org/html/2606.12587#S1.I1.i1)中,\(x\) 可能包含患者的初始症状和病情描述,而 \(y_0\) 是医疗助手的初始建议。然后策略决定是按照此建议进行,还是在产生受支持的响应之前寻求额外的临床证据。

此抽象让我们能够形式化支持的价值及其成本。

#### 支持的价值。
我们首先引入一个**价值指示器** \(g(X, Y_0, Y_1) \in \{0,1\}\),它指示在比较未受支持的结果 \(Y_0\) 和受支持的结果 \(Y_1\) 之后,支持是否在该实例上被判定为有实质帮助。因此,\(g=1\) 意味着支持有帮助,而 \(g=0\) 意味着没有帮助。这个概念刻意与寻求支持的成本分开:\(g\) 仅根据提供者或下游用户对性能的评判标准,评估受支持的结果是否更好。该指示器引出了我们框架中的一个核心总体量,即**支持的价值**,\(\operatorname{val}(x, y_0) := \mathbb{P}(g(X, Y_0, Y_1)=1 \mid X=x, Y_0=y_0)\)。换言之,val

³ 在决定是否寻求支持之前,可以避免或仅部分生成未受支持的输出(\(Y_0\))。我们的框架和保证对此类选择具有鲁棒性;我们在第4节(https://arxiv.org/html/2606.12587#S4)和附录B.9(https://arxiv.org/html/2606.12587#A2.SS9)中进一步讨论。

相似文章

提升AI智能体的速度与能效

MIT News — Artificial Intelligence

麻省理工学院和微软的研究人员开发了一种智能系统,可自动优化智能体工作流,在保持性能的同时减少计算资源和能源消耗。

ALSO:面向社交智能体的对抗性在线策略优化

arXiv cs.AI

ALSO引入了一个多智能体社交模拟中的在线策略优化框架,将多轮交互建模为对抗性赌博机问题,并利用神经代理进行奖励预测。在Sotopia基准上的实验表明,它优于静态基线和现有优化方法。

SAAG:决定AI实际适用场景的实用方法论

Reddit r/AI_Agents

SAAG(简化、自动化、智能体化、防护)是一种实用方法论,用于决定AI在业务中的适用位置,强调在自动化和智能体化之前先进行简化,并设置防护措施以降低风险。