@_akhaliq: StateAct——在像素之前使用程序状态,用于长时域计算机使用代理 论文: https://huggingface.co/papers/2607.2…

X AI KOLs Timeline 论文

摘要

StateAct 提出了一种代码优先的多代理系统,用于长时域计算机使用代理,该系统直接操作程序状态而非截图,在 OSWorld2.0 上实现了更高的成功率和更低的成本。

StateAct 在像素之前使用程序状态,用于长时域计算机使用代理 论文: https://t.co/zoRp9WfYsq https://t.co/BBSSxFCX1e
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:31

StateAct

在像素之前处理程序状态,用于长周期计算机使用智能体

论文:https://t.co/zoRp9WfYsq https://t.co/BBSSxFC1Xe


论文页面 - StateAct:在像素之前处理程序状态,用于长周期计算机使用智能体

来源:https://huggingface.co/papers/2607.22798

摘要

计算机使用智能体通常通过强化感知能力来改进:更好的模型用于读取截图并选择点击位置。然而,截图只是底层程序状态的有损渲染,例如,文件、应用程序后端和保存任务数据的DOM。不同的状态可以产生相同的像素,而代码可以直接检查和修改该状态。StateAct是一个围绕这一区别构建的代码优先、多智能体框架。其主要智能体通过使用代码直接处理程序状态,而专门的GUI子智能体处理需要截屏和点击交互的少数子目标,仅占108个任务中的28个,以及主智能体步骤的1.1%。对程序状态的相同直接访问也支持验证:一个独立的完成门控双重检查保存结果是否存在结构故障,例如,输出缺失、未保存或写入错误路径。为了在数百个步骤中保持正轨,主智能体将子目标分配给新的子智能体,保持自己的上下文专注。在OSWorld 2.0上,StateAct将Claude Opus 4.8的二元成功率从20.6%提升至26.9%,部分成功率从54.8%提升至61.6%,每个任务的成本比仅使用截图的同一模型低约9倍;没有GUI子智能体的纯代码变体仅达到45.9%的部分成功率,低于截图基线54.8%。总的来说,将行动、验证和记忆扎根于状态中(我们称之为状态扎根),将主要瓶颈从感知转向推理:失败更多地取决于智能体的思考,而非它的所见。

查看 arXiv 页面 (https://arxiv.org/abs/2607.22798)查看 PDF (https://arxiv.org/pdf/2607.22798)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22798)

在你的智能体中获取这篇论文:

hf papers read 2607\.22798

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用这篇论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.22798以从此页面链接。

引用这篇论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2607.22798以从此页面链接。

引用这篇论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.22798以从此页面链接。

包含这篇论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

PreAct: 能够更快处理重复任务的计算机操控智能体

arXiv cs.AI

PreAct 将计算机操控智能体的成功任务执行编译为小型状态机程序,通过跳过每步的语言模型调用,实现重复任务上的快速重放(快 8.5–13 倍),同时每一步验证屏幕状态,并在出现不匹配时回退到智能体。