AI网络数据基础设施层的出现

MIT Technology Review 新闻

摘要

本文讨论了为AI模型提供新鲜、实时、可信数据而对网络数据基础设施层日益增长的需求,强调了静态训练数据等挑战以及检索增强生成的重要性。

<p>人工智能正在蓬勃发展。每天都有新的用例涌现。为了利用这项技术的潜力,企业需要大规模的数据。然而,在许多情况下,相关信息被屏蔽或非结构化,这限制了AI模型对它们的使用。&nbsp;</p> <p>要理解这一挑战,不妨考虑一下网络本身的基础。网络并非为满足新兴AI应用所需的自动发现和检索而设计。克服这一固有设计限制需要基础设施。</p> <figure class="wp-block-image size-full"><img decoding="async" width="1298" height="808" src="https://wp.technologyreview.com/wp-content/uploads/2026/06/iStock-1714934690.jpg" alt="" class="wp-image-1139428" srcset="https://wp.technologyreview.com/wp-content/uploads/2026/06/iStock-1714934690.jpg 1298w, https://wp.technologyreview.com/wp-content/uploads/2026/06/iStock-1714934690.jpg?resize=300,187 300w, https://wp.technologyreview.com/wp-content/uploads/2026/06/iStock-1714934690.jpg?resize=768,478 768w" sizes="(max-width: 1298px) 100vw, 1298px" /></figure> <p>AI的下一个前沿可能取决于一个新的网络数据基础设施层,该层能让模型发现并映射这个不断扩展的数字领域。这一层必须能够导航数以亿计的现有网络域名以及每周创建的数十亿新URL,实时提供信息并克服技术障碍。</p> <p>“数据表明,外部存在的数据远比我们知道的要多,”网络数据收集平台Bright Data的CEO Or Lenchner说,“想象一下宇宙:它就在那里,但你所不知道的远比你已知的多。”</p> <h3 class="wp-block-heading">实现新鲜、相关且可信的数据访问</h3> <p>尽管早期AI突破是由扩展训练数据和模型规模驱动的,但组织现在遇到了一个根本性瓶颈:他们需要跟上网络数据动态、非结构化且不断演变的特性,以便将输出建立在当前且可验证的信息之上。AI性能越来越不仅取决于模型架构,还取决于系统的计算、网络、检索和数据工程能力——即系统快速可靠地检索新鲜、相关且可信数据的能力。</p> <p>传统的模型训练依赖于在特定时间点收集的信息快照。在如此静态的数据上训练AI已不再足够。为了跟踪竞争对手定价、消费者情绪和市场趋势等波动,企业需要源源不断的新信息,实时拉取数据并附带相关上下文。因此,他们的基础设施必须能够处理跨不同地域、语言、格式和访问规则的数百万次同步交互。</p> <p>“如果无法检索实时信息,它就会缺乏上下文,”Lenchner说,“在商业环境中,这已不再可接受。过时的答案会导致糟糕的决策和失望的消费者。”</p> <p>速度不仅仅是方便的问题,而是必要性的问题。当今的组织在价格、库存、市场、安全威胁和客户行为不断变化的环境中运营。延迟的数据检索可能会降低一个原本复杂的模型的实用性。</p> <p>使用实时、高质量的网络数据还可以减少AI幻觉,因为模型拥有更相关的知识库。这可以建立用户信任。事实上,一项调查发现,<a href="https://brightdata.com/static/web/data-for-ai-2026.pdf?md5=21346234-7d23c837" target="_blank" rel="noreferrer noopener">56%的AI从业者</a>表示,企业需要访问实时网络数据以提高对AI输出的信任。为了确保模型高效且有效地运行,信息还必须精简到合适的核心内容。&nbsp;</p> <p>尽管引入了检索增强生成(RAG),即模型在查询时拉取外部数据,但许多AI系统在运营环境中仍然难以提供当前、上下文相关且可信的输出。据Gartner称,<a href="https://www.gartner.com/en/newsroom/press-releases/2025-02-26-lack-of-ai-ready-data-puts-ai-projects-at-risk?utm_source=chatgpt.com&amp;_its=eF4ljksOgzAMRO_idZES43zoDbroGZDBRo1EQUrTbhCcvUHsZjSjmbfBLwncAclOhJ1v0LqxIcfYDCLaKEbTOjuIY4EbfAoXrfU8l8OG4NFEtPGYeZED-9ZEh9Rz6k3XxtEHixKJgvgBHYVAk584qGFfp7iUnIZvSesC9w1kfXOqCmqUddKcNV9ufPGy6PyomNdBxcjjc5UThBPs1aeiZ07Gtnb_AwAZPUI" target="_blank" rel="noreferrer noopener">60%的AI项目</a>如果没有AI就绪数据(即准确、结构化、有组织且上下文化的)支持,将在年底前被放弃。&nbsp;</p> <p>这是因为仅靠大规模检索并不能解决问题。正如Lenchner所说,“你需要大规模检索数据,但同时也要实时。延迟成为问题,因为最终用户在等待输出。”&nbsp;</p> <p>大规模访问新鲜、AI就绪的数据带来了技术和结构上的挑战。在实践中,许多企业系统在其AI应用中结合了公共网络检索与API、许可数据集和专有内部数据。将这些分散的来源整合成一个及时且可用的知识层需要专门的能力。一些研究发现,<a href="https://brightdata.com/static/web/data-for-ai-2026.pdf?md5=21346234-7d23c837" target="_blank" rel="noreferrer noopener">97%的AI组织</a>依赖实时网络数据基础设施,但90%认为受到各种限制的束缚。公司正在开发技术方法来应对这些约束。</p> <p>Lenchner打了这样一个比方:“把训练好的模型想象成智力,把相关数据想象成知识。一个强大的智力层坐落在空洞的知识层之上,就像一个什么都不懂的天才——在实践中毫无用处。智力和知识必须结合起来。”</p> <h3 class="wp-block-heading">新基础设施的承诺</h3> <p>一个新的网络数据基础设施层可以通过实现数据发现、实时访问和定制化上下文来解决日益增长的更强AI输入需求。正如Lenchner所描述的,“一切都关乎以超低延迟大规模收集数据,而不被屏蔽。”</p> <p>这种平台不是依赖增加计算能力,而是模拟人类浏览行为来访问可用内容,并将原始代码转化为结构化的数据流。它可以处理那些可能不与传统抓取工具交互的网站,例如大量使用JavaScript的网站,或装有激进的防机器人软件的网站。&nbsp;</p> <p>正如Lenchner解释的那样,“这基本上就是拥有一种基础设施,可以模拟具有标识信息(IP地址、位置以及1000多个参数)的网络用户。而且要规模化。想象一下,每天对数百万个网站重复80亿次。每一次,你看起来都完全符合网站的预期。”</p> <p>当然,持续检索带来了新的数据治理挑战。为了解决这些问题,平台可以强制执行与全球隐私框架(如欧盟的《通用数据保护条例》GDPR和《加州消费者隐私法案》CCPA)一致的严格合规协议。它们还可以仅限于公开可访问的公共信息,避免付费墙或私人登录。所使用的任何网络都可以经过审查并获得同意,并且可以向IP地址所有者提供激励。这样,系统就可以设计为符合日益严格的监管要求。</p> <p>如此复杂的能力并非易事。“当这对一家公司来说是关键基础设施时,”Lenchner说,“内部开发就变成了一个全职的工程问题,与实际的AI工作竞争。”Addr
查看原文
查看缓存全文

缓存时间: 2026/06/24 13:45

# AI的网络数据基础设施层的兴起 来源:https://www.technologyreview.com/2026/06/24/1139202/the-emergence-of-the-web-data-infrastructure-layer-for-ai AI正在蓬勃发展,每天都有新的用例涌现。为了充分利用该技术的潜力,企业需要大规模的数据。然而,在许多情况下,相关信息被封锁或非结构化,限制了AI模型对其的使用。 要理解这一挑战,不妨思考一下网络本身的基础。互联网并非为新型AI应用所需的自动发现和检索而设计。克服这一固有的设计限制需要基础设施的支持。 AI的下一个前沿领域可能依赖于一个新的网络数据基础设施层,该层能够使模型发现并映射这个不断扩张的数字领域。这一层必须能够导航数亿个现有网络域以及每周新增的数十亿个新URL,实时提供信息并克服技术障碍。 “数据表明,还有更多的数据存在,”网络数据收集平台Bright Data的CEO Or Lenchner说道。“想象一下宇宙:它就在那里,但你不知道自己不知道什么。” ### 实现对新鲜、相关且可信数据的访问 虽然早期的AI突破是由训练数据规模和模型大小的扩展驱动的,但组织现在正面临一个根本性的瓶颈:他们需要跟上网络数据的动态、非结构化且不断演变的特性,以便将输出建立在当前且可验证的信息之上。AI的性能越来越不仅取决于模型架构,还取决于系统的计算、网络、检索和数据工程能力——也就是说,系统快速可靠地检索新鲜、相关且可信数据的能力。 传统的模型训练依赖于在特定时间点收集的信息快照。在这样的静态数据上训练AI已不再足够。为了追踪竞争对手定价、消费者情绪和市场趋势等波动,公司需要持续的新信息流,实时拉取数据并附带相关上下文。因此,他们的基础设施必须能够处理跨不同地理、语言、格式和访问规则的数百万个同时交互。 “如果不能检索实时信息,它就缺乏上下文,”Lenchner说。“在商业环境中,这已经不可接受了。过时的答案会导致糟糕的决策和失望的消费者。” 速度不仅仅是便利问题,更是必要问题。当今的组织在价格、库存、市场、安全威胁和客户行为不断变化的环境中运营。延迟的数据检索可能会降低本来精密的模型的实用性。 使用实时、高质量的网络数据还可以减少AI幻觉,因为模型拥有更相关的知识库。这有助于建立用户信任。事实上,一项调查发现,[56%的AI从业者](https://brightdata.com/static/web/data-for-ai-2026.pdf?md5=21346234-7d23c837)表示,企业需要访问实时网络数据来提高对AI输出的信任。为了确保模型高效运行,信息还必须精简到适当的必要内容。 尽管引入了检索增强生成(RAG),即模型在查询时刻拉入外部数据,但许多AI系统在运营环境中仍然难以提供当前、上下文相关且可信的输出。根据Gartner的数据,[60%的AI项目](https://www.gartner.com/en/newsroom/press-releases/2025-02-26-lack-of-ai-ready-data-puts-ai-projects-at-risk?utm_source=chatgpt.com&_its=eF4ljksOgzAMRO_idZES43zoDbroGZDBRo1EQUrTbhCcvUHsZjSjmbfBLwncAclOhJ1v0LqxIcfYDCLaKEbTOjuIY4EbfAoXrfU8l8OG4NFEtPGYeZED-9ZEh9Rz6k3XxtEHixKJgvgBHYVAk584qGFfp7iUnIZvSesC9w1kfXOqCmqUddKcNV9ufPGy6PyomNdBxcjjc5UThBPs1aeiZ07Gtnb_AwAZPUI)如果没有AI就绪数据——即准确、结构化、有组织和上下文化的——支持,将在年底前被放弃。 这是因为仅靠大规模检索无法解决问题。正如Lenchner所说,“你需要大规模检索数据,而且还要实时检索。延迟会成为一个问题,因为最终用户在等待输出。” 大规模访问新鲜、AI就绪的数据会带来技术和结构上的挑战。在实践中,许多企业系统在其AI应用中结合了公共网络检索、API、许可数据集和专有内部数据。将这些碎片化的来源整合成一个及时可用的知识层需要专门的能力。一些研究发现,[97%的AI组织](https://brightdata.com/static/web/data-for-ai-2026.pdf?md5=21346234-7d23c837)依赖实时网络数据基础设施,但90%的组织感到受到各种限制。公司正在越来越多地开发技术方法来应对这些限制。 Lenchner打了个比方:“把训练好的模型想象成智能,把相关数据想象成知识。一个强大的智能层坐落在空洞的知识层之上,就像一个什么都不知道的天才——实际上毫无用处。智能和知识必须结合在一起。” ### 新基础设施的前景 新的网络数据基础设施层可以通过实现数据发现、实时访问和针对特定上下文的定制,来满足这一对更强AI输入不断增长的需求。正如Lenchner所描述的,“关键在于大规模收集数据,超低延迟,且不被封锁。” 这种平台不依赖于增加计算能力,而是模拟人类浏览行为来访问可用内容,并将原始代码转换为结构化数据流。它可以处理那些可能不与传统抓取工具交互的网站,比如大量使用JavaScript的网站,或者具有激进反机器人软件的网站。 正如Lenchner解释的那样:“这基本上就是拥有可以模拟网络用户的基础设施,带有识别信息——IP地址、位置,以及1000多个参数。而且还要大规模实现。想象一下每天为数百万个网站这样做800亿次。每一次,你都看起来完全符合网站的期望。” 当然,持续检索会带来新的数据治理挑战。为了解决这些问题,平台可以执行符合全球隐私框架的严格合规协议,例如欧盟的《通用数据保护条例》(GDPR)和《加州消费者隐私法案》(CCPA)。它们也可以仅限于公开可访问的公共信息,避免付费墙或私人登录。所使用的网络可以是经过审查且基于同意的,并且可以向IP地址所有者提供激励。这样,系统就可以设计为符合日益严格的法规。 如此复杂的能力并非易事。Lenchner说:“当这对一家公司来说是关键基础设施时,内部开发就变成了一个全职的工程问题,会与实际的AI工作竞争。”解决这种复杂性需要组织投入大量资源,导致许多组织寻求专门为数据检索、编排和可观测性设计的专业平台。 ### 面向现实世界的基础设施 实时数据检索正在改变AI系统在组织内部的能力。例如,零售公司可以利用公共信息实现动态定价引擎,全球品牌可以跟踪商标侵权行为。 随着生态系统的成熟,投资于这一新兴数据基础设施层的组织将能够更好地构建更灵敏、更可靠、更符合现实世界条件的AI系统——这些系统可以使用最新的网络数据不断适应。随着时间的推移,AI模型与其提供信息的基础设施之间的区别可能甚至开始消失。 正如Lenchner所说:“世界在变化。世界上发生的一切都被上传到公共网络上。新数据的生成量正在增长并加速。” 要了解更多来自Bright Data的信息,请阅读 [《2026年AI数据报告》](https://brightdata.com/ai/data-for-ai-report)。 *本内容由MIT Technology Review的定制内容部门Insights制作。并非由MIT Technology Review编辑人员撰写。它由人类作者、编辑、分析师和插画师研究、设计和撰写。这包括调查的撰写和调查数据的收集。可能使用的AI工具仅限于经过彻底人工审查的辅助生产过程。*

相似文章

生成更好训练数据的智能体(25分钟阅读)

TLDR AI

Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。

AI推理遵循着截然不同的规则(9分钟阅读)

TLDR AI

文章指出AI推理对云数据基础设施提出了独特挑战,其需求更接近高并发OLTP系统,而非传统面向人类速度的应用。文章强调需要优化存储和数据访问层,以应对自主智能体驱动的"AI数据海啸"。