硅谷的另一个中国问题:它在训练他们的AI

Reddit r/ArtificialInteligence 新闻

摘要

这篇《福布斯》文章揭露,像Surge AI和Mercor这样的美国数据标注初创公司正秘密向中国AI实验室出售高质量训练数据,尽管美国实施了芯片限制,但这帮助中国缩小了与美国AI的差距。文章强调了数据基础设施在AI军备竞赛中被忽视的作用,以及围绕专有数据出口的监管盲区。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/05 16:20

# 这些美国初创公司正在让中国AI更聪明 来源:https://www.forbes.com/sites/annatong/2026/08/05/silicon-valleys-other-china-problem-its-training-their-ai/ getty 当硅谷大型数据标注初创公司的美国销售团队参加今年在韩国首尔举行的国际机器学习大会(https://icml.cc/)时,他们做好了向业内大买家献殷勤的准备。这些数据公司——合计估值达数百亿美元,每年向OpenAI和Anthropic等客户提供训练数据,创造数十亿美元收入——早已习惯于追逐那些出了名要求苛刻、善变且难以满足的AI实验室。 但他们发现了另一个急切等待他们的客户:中国AI行业。 一些中国公司拿着采购清单而来。腾讯——此前曾被美国政府认定为与中国军方有关联,该公司对此说法予以否认——向潜在供应商分发了一份详细的训练数据需求书,涵盖金融、网络安全,以及AI领域最令人垂涎的研究目标之一:能够自我改进的AI系统。 虽然美国长期以来一直禁止中国购买驱动美国顶尖AI模型的芯片,但在训练这些模型所需的数据方面,却并未采取同样的防范措施。这种打包的人类专业知识,由专家网络生产,并经过任务设计、评分标准和质量控制体系的塑造,是昂贵数据基础设施的一部分,用于教会模型处理金融建模和编程等困难的专业任务。这项业务每年价值数亿美元,正在帮助中国AI模型缩小与美国对手的差距。 “除了训练模型所需的算力之外,高质量数据是最重要的东西,”艾伦人工智能研究所前研究科学家Nathan Lambert告诉《福布斯》。“当我们试图让模型进入新的、更具挑战性的领域时,获得好数据是杠杆率最高的环节,能让模型真正变得可用。” 《福布斯》查阅的文件和通信记录显示,中国AI实验室的采购方以及Surge AI和Mercor等顶级硅谷数据平台员工的沟通内容,揭示了一笔悄无声息的数亿美元训练数据集交易。这些为OpenAI、Anthropic,在某些情况下还为美国联邦机构提供服务的美国初创公司,同时也在为北京顶尖实验室供货。硅谷正日益同时为AI军备竞赛的双方提供训练。 对于追赶美国AI性能的中国AI实验室来说,实际上只有三条捷径。第一是挖角研究人员。第二是蒸馏——从ChatGPT或Claude的输出中提取数据,用于训练中国模型。这种做法虽然不违法,但明确违反了OpenAI和Anthropic的服务条款,最近还被特朗普政府的科技顾问Michael Kratsios点名批评(https://x.com/mkratsios47/status/2079933645888880708)。第三条路更简单,而且不会带来潜在监管麻烦:从美国AI实验室购买数据的同一批数据供应商那里,购买同样的训练数据。 教AI模型处理复杂的会计或网页实验室协议,不仅仅是收集原始工作产出。真正的秘诀在于数据规格本身:关注什么类型的数据,以及由人类专业人士编写的精密评分标准,推动和引导模型学会驾驭白领工作。通过购买这些数据集,中国实验室高效地买到了为硅谷最优秀模型提供动力的、来之不易的专有判断力。 AI数据顾问Sean Cai——他运营着一个同名数据和强化学习博客——直言不讳地表示:“如果你真正研究中国数据行业的形态,然后再看整个数据供应链,你会意识到,没错,很多推动美国模型进步的美国数据也被卖给了中国实验室。” **中国境内5亿美元的秘密数据供应链** 这条管道从美国数据标注公司直通中国最大的科技巨头,包括被五角大楼标注的腾讯等企业。在一份《福布斯》看到的讯息中,一位腾讯数据采购高管指出,该公司依赖Surge AI提供数据——Surge AI的客户曾包括(https://web.archive.org/web/20241231215759/https://www.surgehq.ai/customers)美国陆军、美国空军和Anthropic。Mercor——上月底刚告知员工自己赢得了美国联邦政府合同——也在与腾讯合作。 《福布斯》审查的其他通信记录也显示出类似的重叠。在短信交流中,蚂蚁集团——支付宝背后的中国科技金融公司——的一位高管承认与美国AI训练数据公司AfterQuery有着密切的合作关系。与中国电商巨头阿里巴巴一位员工的对话录音显示,该公司与AfterQuery和Mercor签有采购协议。内部项目文件显示,美国数据标注初创公司Turing曾与TikTok的中国母公司字节跳动合作。 字节跳动、阿里巴巴、月之暗面(Moonshot)、腾讯和蚂蚁集团未回应置评请求;Mercor拒绝置评。AfterQuery和Surge表示不披露客户信息。Turing在一份声明中表示:“我们为AI前沿提供动力,包括专有模型和开源模型。我们相信两者都将继续增长,而当今一些最强大的开源模型来自美国以外的实验室。” 总体而言,中国排名前六的AI实验室每年在美国数据标注公司上花费约5亿美元——这一数字据两位从腾讯和字节跳动高管处获得市场规模估算的数据标注企业家提供。据一位与多家此类实验室有过接触的人士称,中国AI实验室并不认为自己彼此之间存在直接的采购竞争关系;相反,他们将自己视为一个集体买家群体,寻求顶尖的西方数据集。 美国数据标注公司很乐意卖给他们。据一位熟悉情况的消息人士称,Mercor第二季度来自中国AI实验室的收入占总收入的2%(Mercor的年化收入在6月份已突破20亿美元(https://docs.google.com/document/d/11_EzPB0rFWnSDBmDQLvmRwgC_C7bMKljs-3IOIQncCI/edit?tab=t.0)),并且该公司已为中国的业务专门聘请了一位客户经理。消息人士告诉《福布斯》,AfterQuery业务中更大的一部分——至少5000万美元的经常性收入——来自中国AI实验室。而作为该领域早期开拓者的Surge AI,一直在积极争取这些买家,CEO Edwin Chen亲自前往中国与实验室高管会面。 数据标注公司向中国AI实验室出售定制的一次性项目,以及所谓的“现成”(OTS)数据集:标准化、预先打包的训练集,可转售给多个实验室。听起来似乎无害,但现成数据集远非无关痛痒。它们是用为OpenAI或Anthropic定制项目期间开发的同一种“知识管道”制造的。这意味着购买这些数据集的中国公司同样受益于同样的博士专家网络、质量控制算法和训练后评分标准——正是这些帮助塑造了美国大型AI实验室的训练过程。而这带来了巨大的帮助。在许多情况下,中国实验室只需购买具有经过实战检验的推理结构的OTS数据集,就能绕过数月的试错过程。 “你必须意识到,这些数据的形态有时恰恰来自那些最初为Anthropic定制扩展方向的公司,”AI数据顾问Cai解释道。“一家为Anthropic服务过的数据供应商,用同一套技术栈为中国实验室生产数据,是极其容易的事。” 这使得现成数据集成为数据供应商眼中诱人的利润引擎。由于可以转售给多个AI实验室,它们拥有最高的利润率。一位曾与中国AI实验室交流过的高管表示,中国AI实验室明确告诉美国数据标注公司,他们想购买美国实验室已经买过的所有数据。 Striker VC创始人Max Gazor——该公司投资了许多美国AI模型开发商——承认这一市场现实伴随着某些复杂因素。“我认为这更多是一个道德层面的决定,即公司是否愿意将数据出售给中国AI公司,”他说。 **监管的狂野西部** 华盛顿花了多年时间围绕先进芯片建立地缘政治堡垒。但用于训练AI的人类专业知识却几乎不受任何审查地跨境流动。 这帮助硅谷顶级数据平台成长为数十亿美元的巨头。Mercor成立于2020年,Surge AI成立于2023年,Mercor目前估值目标为200亿美元(https://www.forbes.com/sites/richardnieva/2026/07/09/mercor-fundraise/),而Surge AI据报估值至少为250亿美元(https://www.bloomberg.com/news/articles/2025-07-30/scale-rival-surge-ai-in-talks-for-funding-at-25-billion-value)。与此同时,相对较新的入局者AfterQuery在三个月内将年经常性收入从1亿美元增长到了数亿美元(https://x.com/spencermateega/status/2076325301026721986?s=46&t=hz2C73TMrDAzLHvZvjw1zQ)。虽然其中绝大部分仍来自美国老牌巨头,但海外销售很可能是一个难以抗拒的次要收入来源。 有人表示,向中国出售数据集事关国家安全。“一些人类数据公司与外国对手合作,今天的Kimi K3就是明证,”Micro1 25岁的CEO Ali Ansari最近在X上发文(https://x.com/aliansarinik/status/2078264914217673164)称。“我们认为,一边宣称美国AI霸主地位,一边向与我们处于对抗性竞争关系的国家出售价值数百万美元的数据,这是可耻的。”Micro1表示自己不向美国以外销售数据。Scale AI也曾在2024年因国家安全担忧而放弃与字节跳动的合作意向(https://www.forbes.com/sites/davidjeans/2024/02/02/scale-ai-tiktok-bytedance-security-concerns/)。 这种做法辩护者认为,限制数据销售将扼杀全球开源创新。 “人们无法在不实质性损害美国开源生态的情况下轻易限制数据或AI的出口,”Cai表示,并指出他对此问题不持立场。“那将赋予OpenAI和Anthropic不公平的双头垄断地位,而这本身也有问题。”

相似文章

硅谷在对待中国AI问题上完全分裂

Wired

Wired报道称,硅谷在对待中国开放权重AI模型方面存在严重分歧:一些初创公司反对禁令,而Anthropic等AI巨头则因担忧知识产权盗窃和缺乏安全护栏而推动监管。

美国AI被锁定且专有,它正在失去优势

Hacker News Top

文章认为,中国的开放权重AI策略正超越美国的专有方式,因为像Moonshot和阿里巴巴这样的中国模型以更低成本缩小了与美国前沿模型的差距,而美国的出口管制和锁定服务可能扼杀创新。

Why U.S. Companies Are Quietly Being Run On Chinese AI

Reddit r/ArtificialInteligence

Despite public support for US-made AI, many US tech companies are quietly relying on Chinese open-source models like Qwen and Kimi due to lower cost, higher performance, and faster updates. A USCC report shows 80% of US AI startups use Chinese open-source models as foundations, signaling a significant shift in the infrastructure layer of AI.