主动服务代理:统一的决策框架、方法与评估
摘要
本调查提出了一种使用大语言模型的主动服务代理统一决策框架,将问题表述为部分可观察的序列决策过程,并组织了关于主动性、时机和安全性的方法和评估指标。
arXiv:2609.03727v1 公告类型:新
摘要:大语言模型代理能够规划、调用工具并修改外部状态,但大多数系统仍将明确的用户指令作为固定起点。主动服务将决策上移:代理必须从不完整环境和用户信号中推断服务机会,在保持沉默、提问、协助和行动之间进行选择,并考虑中断、误解、越权和隐私成本。本调查给出了以主动性为中心的操作性定义,并将问题表述为受授权和风险约束的部分可观察序列决策过程。该表述在一个结构化动作中表示时机、内容和传递,同时明确说明了等待的期权价值、提问的决策价值以及反馈引起的状态变化。在此基础上,我们沿一个决策流水线(状态和需求估计、干预门控、动作构建和反馈适应)组织现有方法,并将规定性、预测性、基于模型和回报优化机制描述为非排他性的策略构建组件。我们进一步在流式对话、屏幕、视频、软件工程和人机协作资源中标准化决策单元和三轴证据描述符,并形式化触发、时机、校准、用户负担、安全性和策略价值的指标。综合研究表明,为什么单独的离线分类性能无法预测部署收益,以及为什么长期记忆不是主动性的决定性条件。可靠的服务主动代理反而需要校准的增量干预价值、可验证的授权、可恢复的执行和反事实证据。
查看缓存全文
缓存时间: 2026/09/04 06:10
# 主动服务代理:统一的决策框架、方法与评估
来源:https://arxiv.org/html/2609.03727
曹庭宇、唐远博、唐华泽、胡柯尔††感谢:作者来自 UniCone 团队(https://www\.unicone\.club)。通讯作者:曹庭宇(cao\-ty25@mails\.tsinghua\.edu\.cn)。
###### 摘要
大型语言模型代理能够规划、调用工具并修改外部状态,但大多数系统仍将显式的用户指令作为固定起点。主动服务将决策前移:代理必须从不完整的环境和用户信号中推断服务机会,在静默、询问、协助和行动之间进行选择,并考虑干扰、误解、越权和隐私成本。本综述以主动性为中心给出操作性定义,并将问题表述为受授权和风险约束的部分可观察的序贯决策过程。该表述将时序、内容和传递方式整合在一个结构化动作中,同时明确了等待的期权价值、提问的决策价值以及反馈引发的状态变化。在此基础上,我们沿着一条决策管道(状态与需求估计、干预门控、动作构建、反馈适应)组织现有方法,并描述规定式、预测式、基于模型和回报优化机制作为非互斥的策略构建组件。我们进一步跨流式对话、屏幕、视频、软件工程和人机协作资源规范决策单元和三维证据描述符,并形式化触发、时序、校准、用户负担、安全性和策略价值的度量标准。综合分析表明,为何离线分类性能本身无法预测部署收益,以及为何长期记忆并非主动性的决定性条件。可靠主动服务反而需要校准后的增量干预价值、可验证的授权、可恢复的执行和反事实证据。
###### 索引关键词:主动服务代理、混合主动交互、干预时序、部分可观察决策、澄清、用户建模、评估、安全性。
## I 引言
工具增强的大型语言模型(LLM)已将助手从文本生成器推进至能浏览、编程、操作图形界面并协调多步骤任务的代理。这种能力增长并未解决一个更基本的问题:由谁首先决定该做什么?常见评估始于完整指令,要求系统针对已知任务进行规划。但在持续使用中,需求可能表现为屏幕事件、传感器流、历史偏好或停滞的任务进度,用户可能未及时注意或表达。允许系统主动发起帮助可以缩短从需求到服务的路径,但也可能导致误报、干扰、操纵、隐私暴露和不可逆操作。因此,主动服务并非更频繁的动作,而是在不确定性下,系统应何时承担主动性的决策,以及这样做的价值高于等待的证据。
该问题的基础坚实但分散。混合主动交互将人与系统间的控制权转移构建为预期收益、注意状态和干扰成本之间的权衡\[1 (https://arxiv.org/html/2609.03727#bib.bib1),2 (https://arxiv.org/html/2609.03727#bib.bib2),3 (https://arxiv.org/html/2609.03727#bib.bib3),4 (https://arxiv.org/html/2609.03727#bib.bib4)\]。主动对话研究目标引导、澄清、策略控制和长对话结果\[5 (https://arxiv.org/html/2609.03727#bib.bib5),6 (https://arxiv.org/html/2609.03727#bib.bib6),7 (https://arxiv.org/html/2609.03727#bib.bib7),8 (https://arxiv.org/html/2609.03727#bib.bib8)\]。对话推荐、信息检索和即时自适应干预分别研究偏好诱发、是否询问和上下文触发\[9 (https://arxiv.org/html/2609.03727#bib.bib9),10 (https://arxiv.org/html/2609.03727#bib.bib10),11 (https://arxiv.org/html/2609.03727#bib.bib11),12 (https://arxiv.org/html/2609.03727#bib.bib12),13 (https://arxiv.org/html/2609.03727#bib.bib13)\]。近期主动代理将这些决策扩展至屏幕日志、自我中心视频、纵向记录和工具使用\[14 (https://arxiv.org/html/2609.03727#bib.bib14),15 (https://arxiv.org/html/2609.03727#bib.bib15),16 (https://arxiv.org/html/2609.03727#bib.bib16),17 (https://arxiv.org/html/2609.03727#bib.bib17)\]。这些文献使用不同的时间粒度、静默否定、反馈来源和风险假设。按应用逐项组织会掩盖实际可比较的对象:每个*决策机会*处的信念状态、可行动作和后果。
本综述围绕该对象重组主动服务,并做出三项贡献。
首先,它相对于当前任务规范提供操作性定义,并开发受约束的部分可观察序贯决策模型。静默、询问、协助和执行属于同一动作空间,因此时序、内容和传递可被联合分析。
其次,它沿着一条决策管道(状态估计、干预门控、动作构建、反馈适应)综合方法,同时使用策略构建方式的正交维度来描述规定式、预测式、基于模型和回报优化组件。这避免了在单一分类层级上混合模型机制、训练范式、任务和应用。
第三,它提出可比较的资源领域、度量标准,以及一个三维证据描述符,分离交互真实性、比较设计和人类结果周期。它解释了为何触发F1、内容质量或接受率单独无法代表部署价值,并将授权、可逆性、长期效用和反事实评估纳入同一协议。
补充综述协议记录范围、选择、证据使用和版本规则。
### I-A 与先前综述的关系
主动性已被综述过,但几乎完全在自然语言对话领域内,澄清这些综述的结论(及其局限)促使了此处发展的以决策为中心的综合。下表对比最相关的综述与本综述在范围、组织轴、主动性概念、评估和安全性方面的差异。
主动对话作为既定对象。第一类工作将主动性确立为对话系统的一等属性。Deng等人贡献了最早的主动对话综述,并按对话类型(开放域、任务导向、信息寻求)组织该领域,编录子任务如主题规划、非协作谈判、澄清和偏好诱发及其数据集和度量标准\[6 (https://arxiv.org/html/2609.03727#bib.bib6)\]。其期刊扩展通过预期、主动性和规划形式化主动性,并整合方法、资源和开放问题,包括基于LLM和混合对话中的主动性、评估和伦理\[7 (https://arxiv.org/html/2609.03727#bib.bib7)\]。这些综述将分散任务转变为连贯研究对象,仍是对话主动性的标准参考。
从能力到人类成本。第二类以人本为中心的工作将注意力从主动系统能做什么转向应为用户做什么。Deng等人提出智能-适应性-礼貌分类法,并在五个构建阶段重读文献,认为无节制的主动性被视为侵入性\[8 (https://arxiv.org/html/2609.03727#bib.bib8)\]。相邻的对话推荐综述系统化了偏好诱发、对话管理和为“通过询问来推荐”的系统的评估\[10 (https://arxiv.org/html/2609.03727#bib.bib10)\]。这些综述共同引入用户负担、时序和信任作为设计考量,并映射了最接近主动服务的机制。
相对于当前主动服务代理的四个局限。对照现在出现在屏幕、可穿戴设备、机器人、图形界面和代码仓库中的系统,这些综述共享四个局限。
*第一*,范围限于对话:决策单元是对话轮次,且系统通常被假定已持有说话轮,而主动服务必须决定是否及何时在开放流中从静默转向干预,其中大多数时刻不携带服务事件。
*第二*,它们按对话类型或设计维度组织领域,使模型机制、任务和应用保持在同一层级,未隔离跨场景可比较的对象:每个决策机会处的信念、可接受动作和后果,以及保持静默的期权价值。
*第三*,它们将主动性视为能力(引导对话朝向目标),而非在真实静默替代下的门控选择,因此未充分说明何时不干预、等待和询问的价值,以及授权作为硬约束而非软惩罚。
*第四*,它们命名评估和伦理为开放挑战,但未达成操作协议:它们不提供共同的决策单元模式、校准、时序和覆盖-风险度量、离策略或反事实估计,或存在于动作空间的安全模型,并且大多早于2025-2026年屏幕、自我中心视频、可穿戴和软件工程主动代理浪潮。这些是覆盖和形式化的缺口,而非被综述工作的缺陷,它们回答了当时突出的问题。
本综述的增补。本综述通过改变组织对象而非添加另一个应用列表来响应这些局限。它将对话范围替换为模态无关的决策对象;将逐应用编录替换为一条决策管道和一个正交的策略构建轴;将能力定义替换为嵌入受约束部分可观察决策模型中的指令相对、静默门控定义;以及将开放式更好的评估呼吁替换为具体决策单元、校准、时序、覆盖-风险和离策略度量、证据描述符,以及与授权和可逆性关联的安全模型。据我们所知,先前没有综述在单一决策变量集下组织跨数字工作区、具身和高风险人类服务场景的主动性;论文其余部分展开该说明。
代表性主动性综述及相邻领域与本综述对比。
“对话轮次”和“决策机会”表示比较单元;最后两列记录是否提供操作评估协议和动作空间安全模型。
综述 | 范围 | 组织轴 | 主动性概念 | 评估处理 | 安全性与授权
--- | --- | --- | --- | --- | ---
Deng 等人,IJCAI 2023\[6\] | 文本对话(开放域、任务导向、信息寻求) | 对话类型与子任务 | 引导对话朝向预设目标 | 按任务数据集和度量;伦理作为挑战 | 作为开放挑战讨论
Deng 等人,ACM TOIS 2025\[7\] | 文本对话,包括 LLM 主动对话 | 预期、主动性、规划 × 对话类型 | 在对话中采取主动并预期长期影响 | 整合按任务度量;评估命名开放问题 | 伦理作为未来方向
Deng 等人,SIGIR 2024(立场)\[8\] | 对话代理 | 跨五个阶段的智能、适应性、礼貌 | 平衡目标与用户的人本能力 | 按阶段设计原则;无统一协议 | 礼貌作为设计维度
Jannach 等人,ACM CSUR 2021\[10\] | 对话推荐(相邻) | 系统组件与交互流 | 通过询问诱发偏好并引导选择 | 离线与以用户为中心的 CRS 度量 | 非焦点
本综述 | 对话、GUI、视频、可穿戴、具身、软件工程、人类服务 | 决策管道 × 策略构建机制 | 相对于指令、静默门控的不确定性下决策 | 公共决策单元;触发、时序、校准、覆盖-风险、离策略价值 | 可接受集、分级权限、可恢复性
### I-B 论文组织与符号
图1 (https://arxiv.org/html/2609.03727#S1.F1)概括本综述。第II节定义问题并推导门控结构。第III节沿着决策循环综合方法。第IV节考察基准、度量和证据。第V节将相同框架映射到三种部署场景并陈述可测试的研究问题。第VI节总结论文。
参考说明
图1:受约束的主动服务循环。可观测任务规范ιt和已验证权限账本κ̄t与潜在状态信念bt分离。在准入集Aadm内,代理比较干预与静默的期权价值,并选择一个结构化动作at=(mt,zt,lt),其中mt∈{静默, 询问, 协助, 行动}。橙色值包络仅说明命题1中的一步预排序候选特例;它不强制对四种语义模式固定排序,也不代表实证数据。一般反馈更新信念,而仅经验证的同意、范围变更或撤销事件更新权限账本。记忆和个性化是可选的状态构造机制。图中的符号在第II节正式定义;此处仅注明阅读所需结构。可观测任务规范ιt和可验证权限账本κ̄t与潜在状态信念bt分离,其状态st=(xt,gt,nt,wt,et)收集任务环境、目标与偏好、需求与紧迫性、可中断性和用户认可的长期结果。准入集Aadm同时满足授权和严重风险边界,At⁺是非静默子集,Δη是在固定非负成本乘子η下评估的最佳准入非静默动作相对于静默的增量值;橙色包络仅说明命题1的一步预排序候选特例。一般反馈(ot+1,ft)更新信念,而仅经验证的权限事件ftperm通过协议算子K更新账本。
## II 问题设置与形式化基础
### II-A 相对于指令的主动性作为决策属性
令ht表示时刻t可用的历史,令ιt表示由当前显式请求或预设自动化规则提供的可观测任务规范;授权由可验证账本κ̄t单独表示。规范可能完全决定一个动作...相似文章
感知先行推理:一种高效可靠的主动移动代理的预推理感知框架
本文提出了一种用于主动移动代理的预推理感知框架(PRPF),将干预时机与辅助生成解耦,以提高效率并减少误触发。
Agentick:用于通用序贯决策智能体的统一基准
本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。
预见与学习:在主动式智能体中释放空闲时间计算能力
ProAct 是一种主动式智能体架构,利用空闲时间计算来预见用户需求,提升任务完成的效率与准确性。它引入了 ProActEval 基准测试,涵盖 40 个领域的 200 个场景,相比被动式基线取得了显著提升:所需交互轮次减少 14.8%,用户努力降低 11.7%,幻觉率下降 28.1%。
在线Agent-as-a-Judge:交互式智能体的情境生成评估
提出在线Agent-as-a-Judge评估框架,该框架利用世界内评估智能体主动生成情境来测试交互式社交智能体,在覆盖率和可靠性上优于被动方法。
ProACT:面向多用户协作中故障感知的主动型智能体
ProACT 提出了一个面向多用户协作的故障感知智能体框架,该智能体能够主动检测协作故障并决定是否介入。本文还首次提出了用于评估此类主动型智能体的多用户协作基准。