@dair_ai: 这是提高您的智能体工作流最有效的方法之一。如果您正在构建计算机使用代理,这…

X AI KOLs Timeline 论文

摘要

任务模型归纳(TMI)是一种从原始计算机使用痕迹中归纳结构化任务模型的方法,将代理性能提升30%,并为现实世界工作流提供可审计、可重用的技能。

这是提高您的智能体工作流最有效的方法之一。 如果您正在构建计算机使用代理,这值得您花时间。 任务模型归纳获取某人工作的原始记录,仅包含屏幕截图、鼠标和键盘事件,并将其转化为工作实际如何完成的符号模型。 困难的部分在于真实记录是多线程的。人们在任务中途切换目标。TMI首先发现无约束痕迹中的潜在任务并将其分离,与真实分组达到0.974的一致性。 然后每个恢复的任务获得两样东西:一个目标如何分解的层次目标模型,以及组织执行的控制流过程模型。 它重构了74.9%的观察到的执行步骤,从这些任务模型衍生的技能将保持任务准确性提高了30.0%,超越了最强的工作流归纳基线。 被动痕迹已经存在于大多数工作笔记本电脑上。这项工作只是展示了如何将其挖掘为可审计、可重用的技能。 论文: https://arxiv.org/abs/2608.20319 在我们的学院追踪更多热门AI论文: https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/08/23 21:42

这是提升智能体工作流程最有效的方法之一。如果您正在构建计算机操作智能体,这项技术值得您投入时间。任务模型归纳技术将原始的工作录制内容——仅包含截图、鼠标和键盘事件——转化为对实际工作方式的符号化建模。难点在于真实录制是多线程的。人们会在任务中途切换目标。任务模型归纳技术首先在无约束的交互轨迹中发现潜在任务并进行分离,与真实分组对比达到0.974的吻合度。每个恢复的任务随后获得两项输出:目标的层次化分解模型,以及组织执行过程的控制流过程模型。该技术能重建74.9%的观察执行步骤,基于这些任务模型生成的技能可将保留任务准确率提升30.0%,超越最强的工作流归纳基线方法。大多数工作笔记本电脑中已存在被动交互轨迹,这项研究展示了如何将其挖掘为可审计、可复用的技能。

论文链接:https://arxiv.org/abs/2608.20319
在我们的学院追踪更多前沿AI论文:https://academy.dair.ai


从计算机使用轨迹归纳任务模型

来源:https://arxiv.org/html/2608.20319

摘要
自然计算机使用轨迹——被动记录的截图及鼠标键盘动作——是推导日常工作的符号化、可审计、可复用模型的宝贵资源。随着计算机操作智能体进入实际工作场景,此类模型的重要性日益凸显:智能体需要学习任务的实际执行方式,而组织机构则需要审计和复用这些知识。然而,归纳任务模型面临挑战,因为活动仅表现为底层事件,且现实工作呈现多线程交织的特点。现有方法通常预设给定任务或单一工作流,仅生成步骤级摘要而非结构化任务模型。

我们提出任务模型归纳技术,该方法:(1)在无约束轨迹中发现潜在任务,并解耦并发活动;(2)为每个潜在任务归纳配对的任务模型——将递归目标分解的层次目标模型与组织执行的控制流过程模型相结合。在受控的人类与智能体轨迹实验中,该技术以0.974的吻合度恢复交织任务,并重建74.9%的观察执行步骤,远超最强的工作流归纳基线。在外部评估中,基于任务模型生成的技能使保留任务准确率较基线提升30.0%。

代码库地址:https://github.com/Yucheng-Jiang/task-model-induction

1 引言

自然计算机使用活动轨迹——被动记录的截图与鼠标键盘事件序列——是推导日常工作符号化、可审计、可复用模型的宝贵资源[Shaikh等2025;Wang等2025]。此类工作大多未被文档化,其蕴含的专门知识保持隐性。恢复用户追求的目标及其遵循的流程,能将录制内容转化为对完成内容与方式的显式描述,便于人们审计人类与AI工作的系统模式[Wang等2025]、复用为文档、传递给新从业者。此外,此类轨迹支持智能体无需昂贵标注即可从人类活动中学习[Lu等2025;Song等2026],并通过基于活动的用户模型实现个性化预测[Shaikh等2026]。

图1:计算机使用轨迹的任务模型归纳。截图与输入事件被锚定为语义动作,其交织时间段被分配至潜在任务。每个任务表示为目标层次与控制流算子配对的层次结构。

建模这些轨迹面临三大挑战:在信号层面,光标移动、按键、屏幕像素等原始事件语义信息匮乏,需要大量解释才能将感知观测与语义意图衔接[Yang等2023;You等2024;Zheng等2024;Shaw等2023]。在结构层面,自然工作具有多线程特性,用户会在单次会话中切换无关目标,并在单个任务中追求交织的子目标[Czerwinski等2004;González与Mark 2004;Mark等2008;Adamczyk与Bailey 2004;Iqbal与Horvitz 2007;Salvucci等2009]。在表示层面,轨迹仅捕获执行路径,无法直接揭示驱动每一步骤的目标层次或组织执行的控制流[Stanton 2006;Card 2018;Diaper与Stanton 2003]。

现有方法仅部分解决这些挑战:LLM摘要将交互会话压缩为自由文本,混合并发任务并丢弃目标层次与控制流;直接提示LLM生成任务模型虽能恢复模式但缺乏执行结构(如我们的直接生成基线所示,见§4.3);工作流归纳恢复活动的逐步分解[Chen等2024;Wang等2025],但将录制视为连续工作流,导致交织任务纠缠、子目标扁平化、迭代与分支未被表达[Wang等2025;Zang等2025];轨迹分析方法预设根任务已知[Wang等2024;Grohs等2024],无法扩展至包含潜在多样任务的会话。

我们通过定义任务模型解决这些缺口——对单个任务的显式表示,将其目标层次与执行控制流配对。目标模型将目标层次表示为任务到用户追求的(子)目标的递归分解[Wing 2006;Stanton 2006];过程模型将控制流表示为序列化与迭代算子的组合,即轨迹中仍可观测的结构化编程构造[Böhm与Jacopini 1966]。

从自然计算机使用轨迹恢复任务模型(§2)需要系统联合发现无约束会话的潜在任务,并为每个任务归纳任务模型,无需预先指定任务、边界或描述(图1)。我们提出任务模型归纳技术(§3),该方法依次应对三大挑战:事件锚定与活动分段从视觉上下文恢复原始事件执行内容,并将结果分组为语义动作与活动,衔接底层信号与局部意图(§3.1);潜在任务归纳解开多线程活动流,在无预设任务集的情况下发现任务并将可能不连续的活动分配至各任务(§3.2);任务模型构建在形式有效性约束下构建每个任务的目标模型与过程模型,并将其协调为统一模型,使目标范围与控制流相互一致(§3.3)。

我们通过受控重建人类计算机使用会话进行内在评估(§4),并通过下游智能体学习进行外部评估(§5)。在基于真实人类工作会话录制数据集构建的轨迹上[Wang等2025],我们的方法以0.974的吻合度恢复交织任务,匹配74.9%的观察执行步骤(对比最强工作流归纳基线的30.3%)。使用归纳任务模型生成可复用智能体技能(在保留任务SkillLearnBench[Zhong等2026]上评估)使任务准确率较基线提升30.0%。

我们的贡献如下
• 形式化从无约束轨迹归纳的任务模型,该表示将层次目标分解与结构化控制流配对,基于计算思维与结构化编程定理。
• 提出任务模型归纳技术,该方法将原始事件锚定为语义活动,解开交织会话为潜在任务,并独立归纳每个任务的目标与过程模型,最终在形式有效性约束下协调为统一模型。
• 内在与外部评估表明,该方法比工作流归纳基线更忠实恢复交织任务及其执行结构,且归纳任务模型为下游智能体生成更有效的技能。

2 问题形式化

描述计算机使用会话中的活动对分析、学习和审计至关重要。我们将此过程形式化为从自然计算机使用轨迹中恢复潜在任务及其指定目标与过程的任务模型。设用户在交互计算环境中的计算机使用轨迹为 X=⟨x₁,x₂,…,xₙ⟩,其中每个事件 xᵢ=(sᵢ,aᵢ,τᵢ) 包含截图状态 sᵢ、底层操作(如点击)和时间戳 τᵢ。轨迹反映用户追求一组潜在任务 T={t₁,t₂,…},其中任务 tⱼ 由可能不连续的子序列事件共同实现。

然而,归纳这些潜在任务仍是开放挑战,因为现实中的人类轨迹未预定义任务、边界或事件-任务分配。我们将归纳问题定义为联合发现潜在任务集 T,并为每个任务 t∈T 归纳任务模型 Mₜ,该模型统一两个互补维度:
目标模型 Oₜ:将任务 t 的目标递归分解为用户追求的子目标
过程模型 Pₜ:基于轨迹锚定的控制流算子组合,指定任务 t 的执行如何通过序列化与迭代组织

任务模型 Mₜ 表示为树结构,每个节点将目标与其子节点的控制流算子配对。

3 方法

图2:任务模型归纳概览。(1) 事件锚定与活动分段:根据视觉上下文读取轨迹 X 中的每个鼠标键盘事件,将其分组为语义动作与活动 E(§3.1)。(2) 潜在任务归纳:将每个活动分配至最近现有任务或创建新任务,标识符确保任务在应用和命名变更中保持完整(§3.2)。(3) 任务模型构建:为每个发现的任务归纳目标模型与过程模型,并协调为统一模型,节点同时携带目标与控制流算子(§3.3)。第三阶段红标显示各模型单独的缺失:目标模型将 do xdo y 合并为单叶节点,过程模型从循环体中遗漏 do z,两者在协调的 for-each 结构中恢复。

图3展示了从一次录制会话归纳的任务与任务模型。任务模型归纳技术通过三个阶段从原始计算机使用轨迹恢复任务模型(图2):事件锚定与活动分段从视觉上下文恢复每个事件内容,并将锚定事件分组为语义动作与活动(§3.1);潜在任务归纳发现会话中追求的任务并将活动分配至相应任务(§3.2);任务模型构建为每个任务构建互补的目标模型与过程模型,并协调为单一任务模型(§3.3)。

3.1 事件锚定与活动分段

原始事件(如 click(1900.8, 29.5))本身不携带意图,但轨迹可抽象为支持用户意图推断的语义单元。每个事件通过包围它的截图进行锚定,提供事件单独缺失的视觉上下文。锚定后的轨迹被分段为语义动作,进而形成活动(图2(a))——可推断用户意图的最小单元[Leont’ev 2024]。

锚定过程从事件产生的视觉变化推断其含义。视觉语言模型接收包围每个事件 xᵢ 的截图对 (sᵢ, sᵢ₊₁) 及记录的操作 aᵢ,报告执行内容、操作对象、所在应用及屏幕可见文本的OCR记录。两张截图的差异表明事件变更内容(如 click(1900.8, 29.5) 用于将Codex应用调至前台)。锚定严格基于截图可见证据,仅参考 sᵢ₊₁ 澄清变更内容,不推断事后意图。

分段将锚定事件分组为两层抽象的工作单元:
语义动作收集对单一制品执行的一组连贯交互(如填写表单字段)
活动聚合实现单一意图的连续语义动作序列(如完成整个表单填写)

相似文章

TuiML: 面向 AI 代理的机器学习

arXiv cs.AI

TuiML 是一款专为 AI 代理设计的机器学习库,具备自描述组件和验证工作流,旨在提升代理在 ML 任务中的自主性和可重复性。

TMAS:通过多智能体协同扩展测试时计算

Hugging Face Daily Papers

TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。