@rohanpaul_ai:新的Stanford + Carnegie论文。真实工作的屏幕录制看起来像是代理的免费训练数据。它们并不是,因为…

X AI KOLs Timeline 论文

摘要

这篇论文介绍了Task Model Induction,一种将真实计算机工作的屏幕录制分解为单独任务和目标树的方法,以更好地训练AI代理,与当前的摘要工具相比,在未见任务上的性能提高了30%。

新的Stanford + Carnegie论文。 真实工作的屏幕录制看起来像是代理的免费训练数据。它们并不是,因为没有人以一个干净的步骤序列工作。 人们在不相关的任务之间切换,并重复相同的修复直到通过。大多数工具将其扁平化为一个列表,因此代理学习到了一个无人执行的工作流程。 Task Model Induction,来自Stanford和CMU,首先将录音分解为正在运行的单独任务,然后将每个任务重建为具有完整循环的目标树。 它通过单独的遍历计算出目标和运行顺序,并将它们合并,因为同时向一个模型询问两者会扁平化细节。 这恢复了74.9%的实际发生情况,是当前最佳摘要工具的两倍多,并且由此构建的技能在未见任务上的表现提高了30%。 在会话变得混乱时,如错误修复和死胡同,它是最弱的。 因此,如果你正在挖掘演示以获取代理技能,请提供目标结构,而不是转录文本。 — arxiv.org/abs/2608.20319 标题:“Inducing Task Models from Computer-Use Traces”
查看原文
查看缓存全文

缓存时间: 2026/08/24 01:43

斯坦福大学与卡内基梅隆大学合作发布新论文。

真实工作的屏幕录像看似可以作为智能体的免费训练数据。实则不然,因为无人会按照单一干净的步骤序列开展工作。

人们会在不相关的任务间切换,反复执行相同的修复直至通过。多数工具将这些过程压缩成单一列表,导致智能体学习到的是无人实际执行过的工作流程。

斯坦福与CMU提出的任务模型归纳方法,首先将录像拆解为正在执行的独立任务,随后将每个任务重建为保留循环结构的目标树。

该方法分阶段解析目标与执行顺序再进行整合,因为若要求单一模型同时处理两者会丢失细节层次。

这种方法能还原74.9%的实际发生内容,是现有最佳摘要提取方法的两倍以上,且基于此构建的技能在陌生任务上表现提升30%。

其最薄弱环节在于处理混乱会话——特别是错误修复与死胡同场景。

因此若从演示中挖掘智能体技能,请提供目标结构而非原始转录记录。

– arxiv.org/abs/2608.20319

论文标题:《从计算机操作痕迹中归纳任务模型》

相似文章

@dair_ai: https://x.com/dair_ai/status/2068724104815890889

X AI KOLs Following

重点介绍近期三篇AI论文:SpatialClaw(通过代码实现无需训练的空间推理),SkillWeaver(组合式技能路由,采用分解-检索-组合流水线),以及PreAct(将智能体运行编译为快速状态机,用于重复任务)。