AI智能体让现在的网络感觉奇怪
摘要
文章报道称,AI智能体现在占据了大部分网络流量,代理流量同比增长7,851%,标志着从以人为中心的网络设计向智能体友好界面的根本性转变。
也许我想多了,但越看AI智能体使用网络的样子,就越觉得现在的网络有点尴尬。网站依然默认是人在浏览:读页面、忽略弹窗、猜哪个按钮重要、分辨哪些是营销、哪些是真正有用的内容。但智能体并不会自然地做这些。它需要解析页面、找出可点击的元素、理解表单状态、避开随机弹窗、比较选项、可能调用工具、出错时重试,最后还要确认是否真的完成了任务。这听起来不像“浏览”,更像是让软件假装成人类用户。演示时还行,但我不确定这东西能规模化。这就是为什么在我看来,那些看似无关的东西开始有了联系:MCP、A2A、WebMCP、AI搜索、浏览器智能体、机器人流量、智能体安全——所有这些。不是说它们是一回事,但它们都指向同一个压力:软件正在成为网络的真实用户,而不仅仅是人类。如果这种情况持续下去,那么网站可能需要超越常规UI的东西。不只是更好的HTML或更好的可访问性,而是某种智能体可读/操作可读的层。基本上不是“AI杀死网站”这类夸张说法,更像是网站继续为人类存在,但也要向机器正确暴露自身。有点像SEO——但不再是为搜索引擎爬虫优化内容,而是为智能体实际执行任务而优化。不确定这是真正的架构转变,还是人们给API换了个新名字。更多内容我写在附带的Medium文章里了,有兴趣可以看看。
查看缓存全文
缓存时间: 2026/06/08 17:22
# 网络正在成为AI代理的API
来源:https://medium.com/ai-engineering-collective/the-web-is-becoming-an-api-for-ai-agents-fd057e098cd6
## MCP、A2A、WebMCP,以及提前到来的流量反转
作者:Debjit Dey (https://medium.com/@debjitdey_59101?source=post_page---byline--fd057e098cd6---------------------------------------)
按回车或点击查看全图
图片来源:Igor Omilaev on Unsplash网络构建于一个基本假设之上:有人正在看着页面。
一个人阅读标题、浏览菜单、点击按钮、填写表单、比较选项、查看价格、打开另一个标签页、犹豫片刻,然后最终采取行动。几乎消费互联网的每个部分都围绕着这个循环增长。页面是为眼睛设计的。按钮是为手指设计的。表单是为那些理解"继续"何时意味着"显示下一步"、何时意味着"确认此操作"的人设计的。
这个假设不再成立了。
2026年6月,基于Cloudflare数据的报道让许多基础设施从业者停下脚步:据估计,机器人占到了面向网页内容的HTTP请求的约57.5%,而人类仅占剩下的42.5%。这个数字需要放在背景中理解。HTTP请求不等同于人类注意力、互联网总价值、移动应用使用量、流媒体时长或经济重要性。机器人加载页面并不等同于人类阅读、购买、学习或决策。
尽管如此,作为一个信号,它很难被忽视。根据这一衡量标准,自动化流量已经超过了人类流量。Tom's Hardware在此处报道了Cloudflare的数据 (https://www.tomshardware.com/tech-industry/artificial-intelligence/bots-have-now-passed-human-traffic-online-cloudflare-boss-laments-says-agentic-traffic-wasnt-expected-to-eclipse-real-people-until-next-year)。
更重要的故事不仅仅是自动化流量在增长。网络一直有机器人。搜索爬虫、在线监控器、SEO工具、垃圾脚本、爬虫、欺诈网络和训练数据收集器已经在互联网上存在多年。现在正在改变的是自动化的种类。
一个新的软件消费者正在到来:AI代理。
不是一个抓取文档的爬虫。不是一个检查服务器是否存活的脚本。不是一个提取表格的爬虫。一个代理可以导航、比较、总结、填写表单、检查可用性、认证、提出后续问题,并且越来越多地代表用户行动。
HUMAN Security的2026年AI流量与网络威胁基准报告发现,从2025年1月到12月,月均AI驱动流量增长了187%,一年内几乎翻了三倍。增长最快的类别是代理型AI(agentic AI)。来自AI代理和代理型浏览器的流量同比增长了7,851%。报告可在此处获取 (https://www.humansecurity.com/learn/resources/2026-state-of-ai-traffic-cyberthreat-benchmarks/)。
这是值得关注的转变。爬虫不再是全部故事。软件开始表现得不像一个索引器,而更像一个有目标的用户。
一个人类搜索航班可能会访问五到十个页面。一个代理做同样的工作可以检查数百个选项、比较退改规则、监控价格变化,并只展示最终推荐。这改变了流量的经济学。这改变了归因。这改变了"发现"的含义。这也打破了许多仍然将人类浏览会话视为互联网中心的产品假设。
有趣的部分不是网络变得更加自动化。那已经很明显了。
有趣的部分是网络开始对此做出怎样的回应。
## 人类网络从来就不是好的软件接口
现代网站不仅包含信息。它包含意图,但很多意图隐藏在视觉结构中。
一个按钮可能意味着"立即购买"、"保存草稿"、"请求报价"、"取消订阅"或"删除账户"。一个日期选择器可能依赖于时区、库存、屏蔽日期、本地验证逻辑和用户历史。一个结账流程可能跨越多个页面、客户端状态、服务器状态、支付授权、一个确认弹窗和一封邮件收据。
人类处理这些是因为网络训练了我们。我们知道灰色的按钮通常意味着某些内容缺失。我们知道一个小的向下箭头很可能打开一个下拉菜单。我们知道结账页面何时在询问送货地址、何时即将扣款。我们知道何时该放慢速度。
代理并不真正知道这些事情。它们推断。
它们检查DOM。它们阅读标签。它们猜测按钮的作用。它们模拟点击和按键。当某些东西出错时它们会重试。这常常能成功,但仍然是一个糟糕的抽象。它把代理当作一个被困在浏览器里的人类用户,戳弄着一个从未打算成为机器契约的视觉界面。
这很脆弱。一个设计师重命名按钮、重构表单、将字段移到弹窗后面、更改文案或添加新的验证步骤,代理的计划就可能失败。更糟糕的是,代理可能没有意识到自己已经失败。它可能在部分理解的情况下继续行动。
还有意图的问题。代理点击"继续"是因为它想预览下一步,还是因为它理解了用户已批准购买?它知道取消是不可撤销的吗?它理解某个字段技术上可选但操作上重要吗?
这就是旧网络开始显得尴尬的地方。一个代理不应该猜测某个按钮是否触发结账。页面应该能够声明一个结账能力。代理不应该通过布局推断出某个表单期望护照号码、出发城市、餐食偏好和座位偏好。网站应该暴露一个模式。代理不应该点击五个屏幕才能发现预订是否可退。政策应该在操作之前就提供。
一旦你这样看待,网络开始变成别的东西:一组巨大的工具表面,等待被恰当地描述。
## WebMCP 是迄今为止最清晰的浏览器端信号
在 Google I/O 2026 上,Chrome 引入了 WebMCP,作为其更广泛的"代理型网络"推动的一部分。Chrome 将 WebMCP 描述为一个提议的开放网络标准,允许网站向基于浏览器的代理暴露结构化工具,例如 JavaScript 函数和带注释的 HTML 表单。Chrome 的 I/O 更新在这里 (https://developer.chrome.com/blog/chrome-at-io26),WebMCP 文档在这里 (https://developer.chrome.com/docs/ai/webmcp)。
想法很简单:与其强迫代理抓取 HTML、解释视觉布局并猜测界面元素的作用,网站可以暴露机器可读的操作。
一个旅游网站可以暴露航班搜索工具。一个支持门户可以暴露工单提交工具。一个 SaaS 仪表板可以暴露诊断工具。一个电商网站可以暴露可用性、退货规则、发货窗口和结账准备作为结构化能力,而不是让代理从页面布局中逆向工程。
可见的网站不会消失。用户仍然看到页面。品牌、布局和体验保持不变。但在界面背后,网站暴露了一个动作层,代理可以在几乎不猜测的情况下理解。
这不仅是对 AI 的可访问性。它改变了网站和软件之间的契约。
一个航班网站不再只是一组可供浏览的页面。它变成了一组可以被发现和调用的能力。一个表单不再只是一个视觉对象。它变成了一个结构化的事务边界。一个产品页面不再只是说服性文案和图像。它变成了一个机器可读的表面,用于价格、库存、运输、政策和购买意图。
WebMCP 的一个设计选择特别重要:工具调用与浏览器标签页或 webview 上下文绑定。代理不会在用户视野之外的某个遥远地方悄悄地调用一个不可见的后端端点。动作仍然发生在可见的浏览上下文中。
这种可见性很重要。纯粹的代理到 API 交互可能高效,但感觉像一个黑箱。可见的浏览器上下文给用户更好的机会来理解代理在哪里行动、在做什么以及何时需要批准。
它也创造了新的工程工作。一旦网站可以向代理暴露可调用的工具,产品团队就必须回答以前可以避免的问题。哪些动作应该暴露?哪些需要确认?代理应该看到什么状态?权限应该如何界定?错误应该如何表示?重试应该如何工作?什么需要被记录?
这就是它不再只是浏览器功能而开始成为基础设施的地方。
## MCP 先来,因为集成问题已经够痛苦
WebMCP 属于一个更大的协议转变,这个转变已经酝酿了一年多。
模型上下文协议,简称 MCP,由 Anthropic 在 2024 年引入,作为连接 AI 助手与外部系统的开放标准。Anthropic 将其描述为构建数据源与 AI 驱动工具之间安全双向连接的方式。发布文章在这里 (https://www.anthropic.com/news/model-context-protocol)。官方 MCP 文档将 MCP 描述为一个开源标准,用于将 AI 应用程序连接到外部系统,如工具、数据源和工作流程。文档在这里 (https://modelcontextprotocol.io/docs/getting-started/intro)。
其吸引力不是理论上的。没有标准协议,每个 AI 应用程序都需要自定义集成。一个连接器给 GitHub。另一个给 Slack。另一个给 Postgres。另一个给 Google Drive。另一个给客户支持系统。另一个给内部知识库。另一个给计费平台。
这不能干净地扩展。
MCP 试图通过给 AI 客户端和外部系统一种共享的方式来暴露工具、资源和能力,从而解决集成问题。构建一次服务器,兼容的客户端就可以发现并使用它。
在旧的 API 世界里,开发者针对端点编写代码。在代理世界里,AI 应用程序需要发现存在哪些工具、理解每个工具做什么、决定何时调用一个、提供结构化参数、解释结果并继续任务。
这不仅仅是 API 访问。这是操作上下文。
这就是 MCP 重要的原因。它不只是另一种连接器格式。它是将 AI 系统从文本生成推向工具使用行为的部分之一。
但使 MCP 有用的同一件事也使其危险。一旦代理可以调用工具,模型的输出就不再只是语言。它可以成为一个动作。
一个错误答案是一种失败。一个错误的工具调用是另一种。区别不是表面的。它是操作性的、法律性的、财务性的,有时是不可逆的。
## A2A 出现:当一个代理不再足够时
MCP 主要回答一个问题:代理如何连接到工具、API、数据和工作流程?
Agent2Agent,或 A2A,提出了一个不同的问题:一个代理如何与另一个代理合作?
官方 A2A 文档将其描述为 AI 代理之间通信与协作的开放标准。它还指出 A2A 最初由 Google 开发,并捐赠给了 Linux 基金会。文档在这里 (https://a2a-protocol.org/latest/),Google 的原始公告在这里 (https://developers.googleblog.com/en/a2a-a-new-era-of-agent-interoperability/)。
这个区别很有用。MCP 是代理到工具。A2A 是代理到代理。
一个招聘工作流程可能需要一个寻源代理、一个调度代理、一个背景调查代理和一个 HR 政策代理。一个客户支持工作流程可能需要一个计费代理、一个退款代理、一个物流代理和一个欺诈代理。一个部署工作流程可能需要一个代码代理、一个测试代理、一个安全审查代理和一个发布代理。
在演示中,所有这些都可以压缩成一个带有几个工具的大提示。在生产中,这很快就会变得混乱。
不同的代理可能有不同的所有者、运行时、供应商、权限、内存策略、模型和审计要求。一些代理可能暴露能力而不暴露其内部工具链。一些可能需要协商任务、要求澄清、拒绝请求或返回部分结果。
这就是 A2A 有趣的原因。它把代理们不再当作孤立的聊天机器人,而是更像网络化的服务。
如果 MCP 是工具层,A2A 就是协作层。它们一起指向一个网络,其中软件参与者不仅仅是调用 API。它们发现、委托、协商和协调。
这并不意味着每个产品都需要一群代理。它意味着"应用程序"、"API"、"助手"和"工作流程"之间的旧边界正在变得模糊。
## 搜索正在变成委托
在其历史的大部分时间里,搜索是一个检索界面。你输入关键词。搜索返回链接。你点击、阅读、比较,然后在别处行动。
AI 概览通过总结结果页面内的信息改变了这一循环的一部分。但 2026 年的转变更进一步。在 I/O 2026 上,Google 描述了一种新的 AI 驱动的搜索体验,其中包含搜索内的代理。Google 表示,用户将能够创建和管理信息代理,这些代理监测网络、综合更新,并支持诸如找公寓、购物和本地预订等任务。Google 的搜索更新在这里 (https://blog.google/products-and-platforms/products/search/search-io-2026/)。
这改变了搜索查询的含义。
"1500 美元以下的最佳笔记本电脑"是一个查询。
"追踪 1500 美元以下、Linux 支持良好的笔记本电脑,并在价格降至 1200 美元以下时通知我"是一个委托任务。
"我附近的餐馆"是一个查询。
"找一个周五晚上六人可用的私人卡拉 OK 包间,要求供应夜宵且晚上 9 点后有位置"是一个委托任务。
"飞往东京的航班"是一个查询。
"查找十月份飞往东京的航班,最多一次中转,比较退改政策,并保留最佳选项直到我批准"是一个委托任务。
流量影响是显而易见的。在委托模型中,用户可能不会访问十个网站。代理访问它们、监控它们、比较它们,只返回有用的结果。有时用户在最终确认步骤看到提供商。有时他们可能从未有意义地看到原始页面。
对于出版商、旅游网站、市场平台、本地商家、电商平台、SaaS 产品和服务提供商,这不是一个小变化。旧的游戏是让页面可被搜索引擎发现且对人有说服力。新的游戏是让动作对代理可读且对用户可信。
大多数团队还没有为此做好准备。不是因为他们粗心,而是因为这个学科几乎还不存在。
## 安全模式落后于产品野心
代理型 AI 中最困难的问题不是工具调用。而是权限。
一个提供错误建议的聊天机器人产生质量问题。一个重置密码、发送资金、更改生产数据、预订不可退票或删除记录的代理造成安全问题。
这条线正是攻击者现在关注的地方。
在 2026 年 5 月底和 6 月初,报道描述了攻击者操纵 Meta 的 AI 驱动的 Instagram 支持聊天机器人以执行账户访问操作。高知名度的账户据报道受到影响,路透社将这一事件描述为在缺乏足够安全保障的情况下自动化敏感用户功能的一个警示。路透社的报道在这里 (https://www.reuters.com/legal/government/high-profile-meta-ai-chatbot-breach-spotlights-security-risks-automation-2026-06-03/)。TechC
相似文章
Cloudflare 警告机器人和代理流量已超过人类网络流量
Cloudflare 报告称机器人和代理AI流量已超过人类网络流量,标志着由AI代理驱动的互联网使用模式发生重大转变。
“代理网络”即将到来——AI代理直接对话,无需抓取网站
本文探讨了AI代理通过API和MCP等协议直接通信的未来,绕过面向人类的网页界面,并向社区询问采用时间线和用例。
迈向代理优先的Web:为AI代理重新设计互联网
本文提出对万维网进行原则性重新设计,以适应AI代理作为主要中介,涉及访问权限、速率限制和标准化代理标识,从而超越以人为中心的假设。
AI代理正在成为软件用户而非软件功能
作者观察到,AI代理正在成为商业软件的主要用户,焦点从人类用户界面转向代理可访问的API和工具架构。
AI代理是多年来第一款真正让人感觉未来感十足的技术
个人观点:AI代理之所以让人感觉真正未来感十足,是因为它们能够自主规划步骤、使用工具、从错误中恢复,标志着从只会回答问题的AI向真正能执行任务的AI的转变。