你需要理解的关键点:计算机使用代理与浏览器使用代理的区别
摘要
本文解释了计算机使用代理(通过像素截图操作完整桌面界面)与浏览器使用代理(可利用DOM隐藏结构)之间的关键区别,前者是更难的技术问题。
你需要理解的关键点:计算机使用代理与浏览器使用代理的区别
“一个能使用计算机的代理”听起来很简单。但这是什么意思?这意味着代理可以查看软件、点击按钮、填写表单、在工具之间切换,并通过界面完成工作。就像真人一样。
但是!- 代理使用浏览器(如Google Chrome)与代理使用计算机(如MacBook)之间存在巨大差异。想一想在线购物与处理文件的区别。
从外部看,它们可能看起来很相似。代理点击按钮。它填写表单。它在软件中移动。看起来像是真人在做工作。
但在底层,它们并不是同一个问题。在浏览器中,代理通常可以读取页面背后的隐藏结构。它可以看到:这是一个按钮。这是一个表单字段。这是一个下拉菜单。这是可点击的。这种隐藏结构称为DOM。它基本上是一张作弊纸条。一张秘密地图。
但当代理使用完整计算机时,这张作弊纸条通常就消失了。桌面应用、旧企业软件、内部工具...nada。很多时候,代理只能看到屏幕。
这使得问题更加困难。代理必须更像人类一样理解界面。我可以点击什么?什么发生了变化?下一步去哪里?我是否即将点击错误的东西?
而且由于它依赖于屏幕上的内容,它必须做更多的工作。它必须截图。它必须处理这些截图。它必须推理什么发生了变化。它必须决定下一步做什么。
这很昂贵。不仅是财务上,技术上也是如此。更多截图。更多推理。更多延迟。更多出错的机会。
这就是为什么使用计算机的AI代理比使用浏览器的代理更难。浏览器代理通常有一张作弊纸条。计算机使用代理必须处理像素。
这就是你需要理解计算机使用和浏览器使用AI代理的关键点。
--- 借助AI撰写
相似文章
我觉得现在的浏览器代理开始变得不同了。
作者观察到,浏览器代理已从华而不实的演示演变为可靠地执行研究、更新表格、完成工作流等任务,标志着从助手到操作员的转变。
“浏览器代理成本高昂且仍在成熟”这种表述可能忽略了架构方面的问题
讨论了当前使用无头Chrome加AI层的浏览器代理的架构问题,并介绍了Opera Neon的命令行界面作为替代方案,将AI集成到浏览器中,从而降低令牌开销并提高理解能力。
智能体是新的浏览器
作者认为,SaaS 公司不应该构建自己的智能体来控制 API 的用户体验,这就像为了控制网站用户体验而去分叉 Chrome 一样;他们应该专注于数据收集,让智能体来处理呈现和查询。
@browser_use: 您的代理可以绕过任何网站的登录 以下是使用 Browser Use Profiles 的方法:> 创建配置文件并开始设置…
Browser Use 推出了 Profiles,允许代理通过将本地浏览器数据同步到云端来绕过登录,从而实现持久化会话。
打造了一个真正操作你电脑的智能体:哪些好用,哪些不行。
作者介绍了 Clark Agent,这是一个能在用户电脑上执行操作(浏览器、邮件、日历、文件)的 AI 智能体,分享了哪些功能好用,以及常见的痛点如验证码和脆弱的长时间工作流。