@akshay_pachaar: 代理以六种方式访问网站。(谷歌和微软都在押注同一种方式。)让代理购买东西并…
摘要
文章描述了AI代理与网站交互的六种方法,从原始API到内置助手,并强调了WebMCP作为保留代理自主权、无需设置且提供命名操作的方法。
查看缓存全文
缓存时间: 2026/08/30 10:06
智能体通过6种方式访问网站。
(谷歌和微软押注同一种方式。)
让智能体帮你购买商品,并观察它的操作过程。它会对页面进行截图,寻找形似按钮的元素,点击,然后再次截图查看结果。
每次查看都需消耗代币,而一次网页改版就可能导致流程中断。
网站本身清楚其具备的功能——搜索、购物车、结算——但这些功能并未以程序可读的形式明确写明。
以下是六种方式,按与界面的交互程度从远到近排列:
-
原始API接口。你的脚本使用自行管理的密钥调用后端接口。这种方式精确快速,但需要自行查找端点地址,且完全绕过网站界面。
-
后端MCP服务器。公司将功能描述为具名工具,你的智能体直接连接调用。这些定义由熟悉产品的人员编写,因此对应的是真实功能而非推测。界面环节仍被跳过。
-
计算机视觉操作。智能体将实时页面视为图像并点击操作。无需配置,但每次查看都需付费,且页面布局变动会导致其识别混乱。
-
基于DOM的浏览器自动化。智能体读取页面底层代码而非图像。比像素识别更可靠,但工具较为通用,智能体仍需从无标签的div元素和未标注按钮中推断含义。
-
WebMCP方案(Chrome与Edge正在协作开发)。页面通过名称、英文描述和类型化输入来声明自身功能,你的智能体可在浏览器会话中直接调用这些功能。
-
网站内建助手。公司提供聊天界面,选择模型并承担代币费用。它能正常工作,但这不是你的专属智能体,因此它获取的信息无法在其他场景复用。
这六种方式在三方面存在差异:执行任务的智能体归属、操作前的配置需求、以及智能体到达后的信息接收内容。
除一种方式外,其他都会至少缺失这三项特性之一。原始API和后端MCP提供类型化功能但脱离网站界面;计算机视觉操作无需配置但仅提供像素信息;内建助手虽精确却归属于服务商。
WebMCP是唯一兼顾三者的方式:使用你自己的智能体,无需预先配置,通过命名功能而非猜测进行操作。
完整分析如下。
相似文章
“代理网络”即将到来——AI代理直接对话,无需抓取网站
本文探讨了AI代理通过API和MCP等协议直接通信的未来,绕过面向人类的网页界面,并向社区询问采用时间线和用例。
WebMCP:让您的网站与AI代理对话
WebMCP是由Google和Microsoft提出的一项网络标准,它允许网站声明结构化工具供AI代理直接调用,从而用稳定的接口替代脆弱的屏幕抓取技术。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2070860837448040832
Google的Agents CLI提供了一个统一的工具,用于搭建、评估和部署AI代理,解决了代理工程中工作流程碎片化的问题。文章演示了如何使用该CLI构建RAG代理,展示了其与编码代理和ADK模式的集成。
AI agents 即将成为软件买家。还有人在思考这个问题吗?
本文讨论了AI agents作为软件购买者的新兴趋势,指出了缺乏针对agent友好的产品评估、定价发现和自主结账的标准化协议。文章提出了三种现有解决方案——llms.txt、MCP servers和agent checkout protocols——并询问公司是否准备好应对非人类流量。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2093452397402317239
WebMCP是Chrome和Edge团队的浏览器API,使网站能够为AI代理定义操作,与其它方法相比,提供了一种更可靠、更高效的代理与网页内容交互方式。