@FinanceYF5: AI Agent已经会操作电脑,但真正难的才刚开始 1/ 一年时间,电脑操作Agent的成绩从42%升到85%,超过约72%的人类基准。 更关键的是,它们已经从演示走进真实业务。但企业现在关心的,不再是“Agent会不会点按钮”,而是【能…
摘要
AI 电脑操作 Agent 一年内成绩从 42% 提升至 85%,超过约72%的人类基准,并已进入真实业务场景;但企业关注的重点已从基础操作转向能否稳定完成整份工作。
查看缓存全文
缓存时间: 2026/08/12 08:44
AI Agent已经会操作电脑,但真正难的才刚开始
1/ 一年时间,电脑操作Agent的成绩从42%升到85%,超过约72%的人类基准。
更关键的是,它们已经从演示走进真实业务。但企业现在关心的,不再是“Agent会不会点按钮”,而是【能不能稳定完成整份工作】。👇 https://t.co/IR9KuU0Dp7
AI Agents can already operate computers, but the real challenge is just beginning.
1/ In one year, the performance of computer operation Agents has risen from 42% to 85%, surpassing about 72% of human benchmarks.
More crucially, they have moved from demonstrations into real business operations. But what enterprises care about now is no longer “whether the Agent can click buttons,” but [whether it can stably complete the entire task].
2/ 目前最成熟的场景,都是路径明确、重复性高的后台任务:
更新CRM、处理IT工单、操作保险和政府网站、录入合同、处理订单……
尤其是那些没有API、只能由人反复点击旧系统的工作。
3/ 一家消费品数据平台,每月已完成1500万至2000万次自动化网页操作。
当零售商网站改版时,Agent会发现爬虫失效、修复流程并继续运行,维护爬虫所需的工程人力因此减少了一半。
4/ 但85%的任务成功率,不等于业务能可靠运行。
一套流程只要有一步出错,结果可能就失效。比如把合同里的“60天付款”识别成“30天”,表面看完全正常,直到发票出错才会被发现。
真正难的是验证和兜底。
5/ 因此,模型正在变得没那么重要。
有位每月运行数百万次任务的负责人,甚至不知道系统用了什么模型。供应商会在后台自动切换,他只关心任务是否完成。
当重度用户不再看排行榜,排行榜就不再是重点了。
6/ 企业真正愿意付费的,是模型周围那一整套东西:
公司内部流程、权限、验证、失败重试、人工接管和审计。
Agent会操作SAP并不稀奇;难的是理解这家公司遇到什么情况该找谁、如何确认结果,以及出错后怎么处理。
7/ 成本也开始接近临界点:
电脑操作Agent每小时约6–8美元,海外外包约10美元,美国后台员工约30–45美元。
Agent目前仍比人慢,但可以全天运行、随时扩容。接下来决定它能替代多少重复工作的,是可靠性,而不只是模型能力。
你觉得哪些工作最适合先交给Agent?
阅读原文:
以上就是全部
如果您喜欢这个主题:
1.关注我(@FinanceYF5) 2. 点赞+转发下面第一条帖子
Thiel Fellowship 挑人的标准,和“履历有多漂亮”关系不大。
他们最看重3点:对某个领域极度痴迷、既能和顶尖专家聊也能让普通人听懂,以及用有限资源做出超预期成果。
最减分的则是:满口抽象概念,却说不清这周五准备具体做什么。 这个标准看创业者还挺准。
相似文章
@FinanceYF5: 一个下午搭5个AI助手,每个处理你每天手动在做的重复任务 Anthropic工程师用45分钟从零演示怎么拆解一个Agent——什么时候用Tool、什么时候拆成子Agent、prompt写太长了怎么办 大多数人还在全程手动,你们有在用Age…
Anthropic工程师演示如何在45分钟内从零搭建AI Agent,涵盖Tool使用、子Agent拆分和Prompt优化,帮助自动化日常重复任务。
@FinanceYF5: 1/ AI 工程有新税 BVP 的最新调研里,90% 技术/工程团队已把 AI 放进核心流程;代码生成 92%,代码审查增强 79%,Agentic 开发 60%。 真正拉开差距的,不是用不用 AI,而是提速后还能不能守住质量和理解。
BVP最新调研显示,90%技术团队已将AI融入核心流程,其中代码生成使用率达92%,代码审查增强79%,Agentic开发60%。报告强调AI提速后质量和理解能力才是关键差距。
Can Agents Use a Computer Yet? We've Got the Data (17 minute read)
a16z examines progress in computer-using AI agents, citing benchmark improvements that now surpass human-level performance on OSWorld-Verified and noting a shift from raw capability to reliable production deployment in enterprise workflows.
@FinanceYF5: 1/ 微软AI负责人Mustafa Suleyman: 12到18个月内,大多数基于电脑的专业任务将被AI自动化。目标不是低技能岗位,是那些可重复的高薪办公室工作。 这个时间线,比大多数人预期的短
微软AI负责人Mustafa Suleyman预测,未来12到18个月内,大多数基于电脑的专业任务将被AI自动化,目标主要是可重复的高薪办公室工作,这个时间线比大多数人预期的要短。
@FinanceYF5: OpenAI 的工作正在被 agent 改变,几乎覆盖每个部门。 在整个公司内部,人们正使用 Codex 完成更复杂、更长周期、也越来越跨职能的工作。 OpenAI 的内部使用情况,提供了一个早期视角:随着 agentic 工具变得更强大…
OpenAI 内部正全面使用 agent 工具 Codex 完成跨部门工作,展示了 agentic 工具如何重塑工作方式。