@_akhaliq: StateAct——在像素之前使用程序状态,用于长时域计算机使用代理 论文: https://huggingface.co/papers/2607.2…
摘要
StateAct 提出了一种代码优先的多代理系统,用于长时域计算机使用代理,该系统直接操作程序状态而非截图,在 OSWorld2.0 上实现了更高的成功率和更低的成本。
查看缓存全文
缓存时间: 2026/07/28 06:31
StateAct
在像素之前处理程序状态,用于长周期计算机使用智能体
论文:https://t.co/zoRp9WfYsq https://t.co/BBSSxFC1Xe
论文页面 - StateAct:在像素之前处理程序状态,用于长周期计算机使用智能体
来源:https://huggingface.co/papers/2607.22798
摘要
计算机使用智能体通常通过强化感知能力来改进:更好的模型用于读取截图并选择点击位置。然而,截图只是底层程序状态的有损渲染,例如,文件、应用程序后端和保存任务数据的DOM。不同的状态可以产生相同的像素,而代码可以直接检查和修改该状态。StateAct是一个围绕这一区别构建的代码优先、多智能体框架。其主要智能体通过使用代码直接处理程序状态,而专门的GUI子智能体处理需要截屏和点击交互的少数子目标,仅占108个任务中的28个,以及主智能体步骤的1.1%。对程序状态的相同直接访问也支持验证:一个独立的完成门控双重检查保存结果是否存在结构故障,例如,输出缺失、未保存或写入错误路径。为了在数百个步骤中保持正轨,主智能体将子目标分配给新的子智能体,保持自己的上下文专注。在OSWorld 2.0上,StateAct将Claude Opus 4.8的二元成功率从20.6%提升至26.9%,部分成功率从54.8%提升至61.6%,每个任务的成本比仅使用截图的同一模型低约9倍;没有GUI子智能体的纯代码变体仅达到45.9%的部分成功率,低于截图基线54.8%。总的来说,将行动、验证和记忆扎根于状态中(我们称之为状态扎根),将主要瓶颈从感知转向推理:失败更多地取决于智能体的思考,而非它的所见。
查看 arXiv 页面 (https://arxiv.org/abs/2607.22798)查看 PDF (https://arxiv.org/pdf/2607.22798)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22798)
在你的智能体中获取这篇论文:
hf papers read 2607\.22798
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用这篇论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.22798以从此页面链接。
引用这篇论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2607.22798以从此页面链接。
引用这篇论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.22798以从此页面链接。
包含这篇论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
@dair_ai: 关于计算机使用智能体的杰出论文。(收藏)计算机使用智能体通过屏幕操控真实软件,……
PreAct 将成功的智能体运行编译成小型状态机程序,在重复任务上实现 8.5-13 倍更快的重放,无需逐步骤的语言模型调用,并通过运行时屏幕检查确保正确性。
PreAct: 能够更快处理重复任务的计算机操控智能体
PreAct 将计算机操控智能体的成功任务执行编译为小型状态机程序,通过跳过每步的语言模型调用,实现重复任务上的快速重放(快 8.5–13 倍),同时每一步验证屏幕状态,并在出现不匹配时回退到智能体。
智能体应该说什么?面向高效多智能体系统的动作状态通信
本文介绍了PACT,一种用于在多智能体LLM系统中构建智能体间通信的方法,它使用紧凑的动作状态记录来减少令牌消耗,同时保持或提高任务性能,并在SWE-agent和OpenHands上展示了效果。
StateComp: 学习在长时程智能体中何时压缩历史记录
StateComp是一个根据当前状态压缩长时程智能体历史交互的框架,可将令牌使用量减少52.27%,并在保持任务性能的同时,使表示提取速度提升12.67倍。
@yoheinakajima: 更多人现在正在尝试这种通过共享状态进行通信的智能体方法(而非彼此对话)
Azalia Mirhoseini 强调 DeLM,一种去中心化语言模型方法,其中智能体通过共享状态通信,在SWE-bench Verified上使用Gemini-3 Flash实现了约10%的提升,且成本不到一半。