@akshay_pachaar: 代理以六种方式访问网站。(谷歌和微软都在押注同一种方式。)让代理购买东西并…

X AI KOLs Following 新闻

摘要

文章描述了AI代理与网站交互的六种方法,从原始API到内置助手,并强调了WebMCP作为保留代理自主权、无需设置且提供命名操作的方法。

代理以六种方式访问网站。 (谷歌和微软都在押注同一种方式。) 让代理购买东西并观看其工作。它会对页面进行截图,寻找形似按钮的东西,点击,然后再次截图查看发生了什么。 每次查看你都需要支付令牌,而一次重新设计就会中断运行。 网站已经知道它能做什么。它有搜索、购物车、结账功能,而这些都没有在任何程序能读取的地方记录下来。 以下是六种方法,按从最远离界面到最近的顺序排列。 1) 原始API。你的脚本使用你管理的密钥调用后端。精确且快速,尽管你必须自己找到端点,且网站从未介入。 2) 后端MCP服务器。公司将其操作描述为命名工具,你的代理连接到它们。由了解产品的人编写这些定义,因此它们命名的是真实操作而非猜测操作。界面仍然被跳过。 3) 计算机使用。代理将实时页面视为图像并点击周围。无需配置,但每次查看都花费金钱,且布局更改会使其困惑。 4) 基于DOM的浏览器自动化。代理读取页面的底层代码而非其图像。比像素更可靠,但工具是通用的,因此代理仍然从匿名div和无标签按钮中推断意义。 5) WebMCP,Chrome和Edge正在共同构建的那个。页面声明自己的操作,包括名称、纯英语描述和类型化输入,你的代理在你的实时浏览器会话中调用它们。 6) 网站的内置助手。公司提供聊天框,选择模型,并支付令牌费用。它有效,但它不是你的代理,因此它关于你学到的任何内容都不会传递到其他地方。 这六种方式在三个方面有所不同:谁的代理执行工作,在任何事情发生前你配置什么,以及代理到达时收到什么。 除了一个选项外,每个选项都放弃了至少这三个方面之一。原始API和后端MCP提供类型化操作并移除网站。计算机使用无需设置并交出像素。内置助手精确且属于供应商。 WebMCP是唯一一个保留所有这三个方面的。你自己的代理,无需配置,以及命名操作而非猜测。 我写了完整的分析。文章引用如下。
查看原文
查看缓存全文

缓存时间: 2026/08/30 10:06

智能体通过6种方式访问网站。

(谷歌和微软押注同一种方式。)

让智能体帮你购买商品,并观察它的操作过程。它会对页面进行截图,寻找形似按钮的元素,点击,然后再次截图查看结果。

每次查看都需消耗代币,而一次网页改版就可能导致流程中断。

网站本身清楚其具备的功能——搜索、购物车、结算——但这些功能并未以程序可读的形式明确写明。

以下是六种方式,按与界面的交互程度从远到近排列:

  1. 原始API接口。你的脚本使用自行管理的密钥调用后端接口。这种方式精确快速,但需要自行查找端点地址,且完全绕过网站界面。

  2. 后端MCP服务器。公司将功能描述为具名工具,你的智能体直接连接调用。这些定义由熟悉产品的人员编写,因此对应的是真实功能而非推测。界面环节仍被跳过。

  3. 计算机视觉操作。智能体将实时页面视为图像并点击操作。无需配置,但每次查看都需付费,且页面布局变动会导致其识别混乱。

  4. 基于DOM的浏览器自动化。智能体读取页面底层代码而非图像。比像素识别更可靠,但工具较为通用,智能体仍需从无标签的div元素和未标注按钮中推断含义。

  5. WebMCP方案(Chrome与Edge正在协作开发)。页面通过名称、英文描述和类型化输入来声明自身功能,你的智能体可在浏览器会话中直接调用这些功能。

  6. 网站内建助手。公司提供聊天界面,选择模型并承担代币费用。它能正常工作,但这不是你的专属智能体,因此它获取的信息无法在其他场景复用。

这六种方式在三方面存在差异:执行任务的智能体归属、操作前的配置需求、以及智能体到达后的信息接收内容。

除一种方式外,其他都会至少缺失这三项特性之一。原始API和后端MCP提供类型化功能但脱离网站界面;计算机视觉操作无需配置但仅提供像素信息;内建助手虽精确却归属于服务商。

WebMCP是唯一兼顾三者的方式:使用你自己的智能体,无需预先配置,通过命名功能而非猜测进行操作。

完整分析如下。

相似文章

WebMCP:让您的网站与AI代理对话

Hacker News Top

WebMCP是由Google和Microsoft提出的一项网络标准,它允许网站声明结构化工具供AI代理直接调用,从而用稳定的接口替代脆弱的屏幕抓取技术。

AI agents 即将成为软件买家。还有人在思考这个问题吗?

Reddit r/artificial

本文讨论了AI agents作为软件购买者的新兴趋势,指出了缺乏针对agent友好的产品评估、定价发现和自主结账的标准化协议。文章提出了三种现有解决方案——llms.txt、MCP servers和agent checkout protocols——并询问公司是否准备好应对非人类流量。