@FinanceYF5: AI Agent已经会操作电脑,但真正难的才刚开始 1/ 一年时间,电脑操作Agent的成绩从42%升到85%,超过约72%的人类基准。 更关键的是,它们已经从演示走进真实业务。但企业现在关心的,不再是“Agent会不会点按钮”,而是【能…

X AI KOLs Following 新闻

摘要

AI 电脑操作 Agent 一年内成绩从 42% 提升至 85%,超过约72%的人类基准,并已进入真实业务场景;但企业关注的重点已从基础操作转向能否稳定完成整份工作。

AI Agent已经会操作电脑,但真正难的才刚开始 1/ 一年时间,电脑操作Agent的成绩从42%升到85%,超过约72%的人类基准。 更关键的是,它们已经从演示走进真实业务。但企业现在关心的,不再是“Agent会不会点按钮”,而是【能不能稳定完成整份工作】。👇 https://t.co/IR9KuU0Dp7
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:44

AI Agent已经会操作电脑,但真正难的才刚开始

1/ 一年时间,电脑操作Agent的成绩从42%升到85%,超过约72%的人类基准。

更关键的是,它们已经从演示走进真实业务。但企业现在关心的,不再是“Agent会不会点按钮”,而是【能不能稳定完成整份工作】。👇 https://t.co/IR9KuU0Dp7

AI Agents can already operate computers, but the real challenge is just beginning.

1/ In one year, the performance of computer operation Agents has risen from 42% to 85%, surpassing about 72% of human benchmarks.

More crucially, they have moved from demonstrations into real business operations. But what enterprises care about now is no longer “whether the Agent can click buttons,” but [whether it can stably complete the entire task].

2/ 目前最成熟的场景,都是路径明确、重复性高的后台任务:

更新CRM、处理IT工单、操作保险和政府网站、录入合同、处理订单……

尤其是那些没有API、只能由人反复点击旧系统的工作。

3/ 一家消费品数据平台,每月已完成1500万至2000万次自动化网页操作。

当零售商网站改版时,Agent会发现爬虫失效、修复流程并继续运行,维护爬虫所需的工程人力因此减少了一半。

4/ 但85%的任务成功率,不等于业务能可靠运行。

一套流程只要有一步出错,结果可能就失效。比如把合同里的“60天付款”识别成“30天”,表面看完全正常,直到发票出错才会被发现。

真正难的是验证和兜底。

5/ 因此,模型正在变得没那么重要。

有位每月运行数百万次任务的负责人,甚至不知道系统用了什么模型。供应商会在后台自动切换,他只关心任务是否完成。

当重度用户不再看排行榜,排行榜就不再是重点了。

6/ 企业真正愿意付费的,是模型周围那一整套东西:

公司内部流程、权限、验证、失败重试、人工接管和审计。

Agent会操作SAP并不稀奇;难的是理解这家公司遇到什么情况该找谁、如何确认结果,以及出错后怎么处理。

7/ 成本也开始接近临界点:

电脑操作Agent每小时约6–8美元,海外外包约10美元,美国后台员工约30–45美元。

Agent目前仍比人慢,但可以全天运行、随时扩容。接下来决定它能替代多少重复工作的,是可靠性,而不只是模型能力。

你觉得哪些工作最适合先交给Agent?

阅读原文:

以上就是全部

如果您喜欢这个主题:

1.关注我(@FinanceYF5) 2. 点赞+转发下面第一条帖子

Thiel Fellowship 挑人的标准,和“履历有多漂亮”关系不大。

他们最看重3点:对某个领域极度痴迷、既能和顶尖专家聊也能让普通人听懂,以及用有限资源做出超预期成果。

最减分的则是:满口抽象概念,却说不清这周五准备具体做什么。 这个标准看创业者还挺准。

相似文章

@FinanceYF5: 1/ AI 工程有新税 BVP 的最新调研里,90% 技术/工程团队已把 AI 放进核心流程;代码生成 92%,代码审查增强 79%,Agentic 开发 60%。 真正拉开差距的,不是用不用 AI,而是提速后还能不能守住质量和理解。

X AI KOLs Following

BVP最新调研显示,90%技术团队已将AI融入核心流程,其中代码生成使用率达92%,代码审查增强79%,Agentic开发60%。报告强调AI提速后质量和理解能力才是关键差距。