在真实网页任务中测试浏览器智能体后,我认为我们责怪模型找错了问题
摘要
作者认为,AI智能体在真实网页任务中失败并非因为模型能力弱,而是因为浏览器是为人类设计的,缺乏供智能体使用的隔离、可编程工作空间。
我一直在测试Claude Code / Codex风格的智能体处理超越“打开这个页面并总结”的网页任务。这些任务故意设计得无聊且真实:
* 从某个X账户拉取最近的帖子,并按浏览量/参与度排序
* 使用Redfin筛选条件,打开一个房源,更新按揭计算器
* 在Expedia上搜索航班,选择一个有效选项,填写乘客信息,在付款前停止
我反复看到的模式是:智能体经常知道计划。但浏览器会出问题。它没有干净的工作场所。它会与你的活动标签页冲突。登录会话很尴尬。截图变得过时。多步骤流程变成“点击,等待,观察,点击,等待,观察”的循环。如果发生任何意外,恢复过程一团糟。
常见的说法是:“AI智能体依然不够擅长使用网站。”我开始认为更好的说法是:“网页浏览器从未为智能体设计过。”
浏览器假设一个人、一个光标、一个前台任务。但**智能体需要一个不同的环境**:隔离的工作空间、持久的登录状态、并行执行,以及用代码编写复杂网页流程的能力。
好奇这里大家的看法。浏览器智能体失败是因为模型弱,还是因为我们强迫它们使用面向人类的界面?
相似文章
AI智能体为现实世界工作做好准备了吗?
探讨AI智能体为现实世界工作做好准备的程度,涵盖其当前能力以及围绕可靠性、权限、失败和人工监督的关键未解决问题。
上下文腐烂是智能体在长任务中途崩溃的原因。
文章解释了“上下文腐烂”:随着上下文增长,AI 智能体在长任务上表现下降,甚至在窗口未满时就开始退化,并提供了压缩、状态卸载、按需检索等技术来保持可靠性。
Bb:自我构建的 IDE
介绍 bb,一个开源、本地优先的 IDE,能够自我控制、定制和自动化,集成 Claude、Codex 和 Cursor 等多个 AI 代理,以构建工作流并生成任务。
AI正在移除软件工程的中产阶级
观点文章认为,AI智能体移除了代码变更的速度限制,导致工程文化薄弱的团队积累难以管理的技术债务,使资深工程师的工作变成大规模审查AI生成的PR。
天哪,AI记者竟然真的在爆大新闻
《连线》杂志的一篇文章探讨了像RuntimeWire这样的AI新闻编辑室如何比人类记者更快地发布真实新闻,利用AI智能体寻找消息源、撰写、编辑和发布文章,且几乎无需人工监督。