@rohanpaul_ai:新的Stanford + Carnegie论文。真实工作的屏幕录制看起来像是代理的免费训练数据。它们并不是,因为…
摘要
这篇论文介绍了Task Model Induction,一种将真实计算机工作的屏幕录制分解为单独任务和目标树的方法,以更好地训练AI代理,与当前的摘要工具相比,在未见任务上的性能提高了30%。
查看缓存全文
缓存时间: 2026/08/24 01:43
斯坦福大学与卡内基梅隆大学合作发布新论文。
真实工作的屏幕录像看似可以作为智能体的免费训练数据。实则不然,因为无人会按照单一干净的步骤序列开展工作。
人们会在不相关的任务间切换,反复执行相同的修复直至通过。多数工具将这些过程压缩成单一列表,导致智能体学习到的是无人实际执行过的工作流程。
斯坦福与CMU提出的任务模型归纳方法,首先将录像拆解为正在执行的独立任务,随后将每个任务重建为保留循环结构的目标树。
该方法分阶段解析目标与执行顺序再进行整合,因为若要求单一模型同时处理两者会丢失细节层次。
这种方法能还原74.9%的实际发生内容,是现有最佳摘要提取方法的两倍以上,且基于此构建的技能在陌生任务上表现提升30%。
其最薄弱环节在于处理混乱会话——特别是错误修复与死胡同场景。
因此若从演示中挖掘智能体技能,请提供目标结构而非原始转录记录。
– arxiv.org/abs/2608.20319
论文标题:《从计算机操作痕迹中归纳任务模型》
相似文章
@rohanpaul_ai: 一篇来自斯坦福、MIT、哈佛和Anthropic的优秀论文。给出了关于为何大型模型能学习……的清晰训练解释。
一项来自斯坦福、MIT、哈佛和Anthropic的论文解释,大型AI模型能更好地学习稀有技能,因为训练期间它们遗忘更少;其额外容量保护弱学习信号不被常见任务覆盖。
@rohanpaul_ai: 非常重要的Meta论文带来Autodata,一个自主数据科学家,用于创建高质量合成数据。主要…
Meta的新论文'Autodata'介绍了一个自主数据科学家,能够生成并元优化合成训练数据,显著优于标准方法,并使一个4B小模型在法律任务中击败了397B的基线模型。
@rohanpaul_ai: Meta 论文显示,当编程代理重复使用过去尝试的简短摘要而不是原始日志时,其性能会显著提升……
一篇 Meta 论文显示,编程代理在重复使用过去尝试的简短摘要而非原始日志时性能显著提升,使用 Claude 4.5 Opus 在 SWE-Bench 和 Terminal-Bench 上取得了显著改进。
@dair_ai: https://x.com/dair_ai/status/2068724104815890889
重点介绍近期三篇AI论文:SpatialClaw(通过代码实现无需训练的空间推理),SkillWeaver(组合式技能路由,采用分解-检索-组合流水线),以及PreAct(将智能体运行编译为快速状态机,用于重复任务)。
@rohanpaul_ai: 这篇来自Meta、斯坦福和伊利诺伊的调研论文认为,当代码成为AI智能体的主要工作层时,它们的效果更好…
这篇来自Meta、斯坦福和伊利诺伊的调研论文认为,当代码被用作AI智能体的主要工作层时,它们表现更好,将代码视为推理、行动和建模的环境。作者引入了‘智能体框架’的概念,包含工具、内存、沙箱和反馈循环。