重新思考数据护城河(6分钟阅读)

TLDR AI 新闻

摘要

文章讨论了在AI发展中,数据与算法进步之间重要性的演变,借鉴研究人员的近期演讲,以强调焦点的转变。

Dwarkesh Patel 与 Ryan Greenblatt 讨论了AI研究自动化,后者强调算法进步是AI进步的主要驱动力,即使在没有人类专家数据的情况下也能带来改进。YouTube Shorts的联合创始人Shuchao Bi表达了类似的观点,强调了需要精炼的数据分布来提升AI模型。两位专家都认为,通过更好的数据处理,AI研究可以加速,挑战了关于人类数据在模型改进中重要性的传统观念。
查看原文
查看缓存全文

缓存时间: 2026/08/19 15:38

# 重新思考数据护城河 来源:https://www.mbi-deepdives.com/data-moat/ 我想重点提及两篇我认为相当引人深思的内容。第一篇是德瓦克什·帕特尔与红木研究公司首席科学家瑞安·格林布拉特的对话(https://www.dwarkesh.com/p/ryan-greenblatt?ref=mbi-deepdives.com)。坦白说,虽然关于自动化AI研究是否会触发递归自我改进的讨论发人深省,但其中有些观点也相当令人不安。 我想强调的第二篇内容是毕楚超题为“推进硅基智能的边界:过去、开放问题与未来”的演讲(https://www.youtube.com/watch?v=E22AOHAEtu4&ref=mbi-deepdives.com)。毕曾在谷歌共同创立YouTube Shorts,在OpenAI负责多模态后训练,目前就职于Meta超级智能实验室。 尽管格林布拉特与德瓦克什的对话发布于上周,但毕的演讲发表于一年多以前。由于我恰好在周末接触了这两份内容,我注意到格林布拉特和毕的论点存在相当多的共通之处。上个月,我曾撰写关于AI与Alphabet语境下**数据重要性**(https://www.mbi-deepdives.com/data/)的文章,而Alphabet为收购精神航空数据(https://www.axios.com/2026/08/17/google-spirit-airlines-bankruptcy?ref=mbi-deepdives.com)参与破产拍卖一事无疑印证了这一点。然而,格林布拉特和毕都促使我重新思考了在这个问题上的立场。格林布拉特提出了一个有趣的思想实验:如果保持计算能力或数据量不变,模型性能还能提升多少?这个改进的幅度可以称为“算法进步”,他认为这是过去几年AI进步非常重要的驱动力(以下强调为本人所加): > “GPT-3发布于2020年,因此其训练时间大约是六年半到七年前。值得注意的是,GPT-3可能稍显过时,但我们暂时以此为例。如果今天我们用GPT-3级别的计算资源来训练一个模型,这个模型会有多好?根据算法进步的作用机制,我的理解是,我们能够训练出一个与大约三年前最佳模型相当的模型。**因此我认为,现在我们能够训练出一个版本的GPT-3,其性能可能略优于GPT-4,比GPT-4好上不少。**我认为大致如此。这与算法进步的作用方式基本吻合。” 毕虽然没有明确使用“算法进步”这一术语,但他指出原始数据“不太可能是最佳的数据分布”。他提出,规模定律的增量改进可能来自于改变数据分布,或者换句话说,通过“均衡每个词元的智能”。我的理解是,他们本质上暗示了相同的论点,只是用不同的词语来解释各自的直觉。 来源:毕楚超的演讲(https://www.youtube.com/watch?v=E22AOHAEtu4&ref=mbi-deepdives.com) 在后续对话中,格林布拉特进一步阐述了他为何不认为“人类专家数据”在模型改进中扮演主要角色,而是数据本身的流程改进才是更大的驱动力。在播客中(以下强调为本人所加): > “我认为绝大多数预训练数据的改进来自于更好地理解哪些数据集是好的科学,以及在弄清楚如何过滤数据上付出的艰苦劳动。因此,我认为像从OpenWebText(https://github.com/Skylion007/openwebtext?ref=mbi-deepdives.com)到FineWeb(https://huggingface.co/datasets/HuggingFaceFW/fineweb?ref=mbi-deepdives.com)这种形式的改进,最好被描述为一种你可以使用一些GPU(https://en.wikipedia.org/wiki/Graphics_processing_unit?ref=mbi-deepdives.com)来研究的算法改进,你不需要人类专家数据来完成这个。现在,有一个不同的效应我们可以讨论,那就是2026年的互联网可能比2018年的互联网是更好的训练数据土壤。还有一种效应是,有更多的互联网用户在发布内容,因此有更多的数据可供采集。我的感觉是,这种效应的影响会远小于人类更善于策划数据、拥有更好的抓取工具、更懂得如何处理这些抓取内容——这类事情的影响。” 格林布拉特的论点确实让我停下来思考,因为我之前的假设有所不同,可能更接近德瓦克什的观点,后者似乎也认为人类专家数据在模型近期的发展轨迹中发挥了关键作用。 毕很可能同意格林布拉特的观点,因为他分解了人类知识的来源:一个提出任务、学习现有知识、思考、从环境获得反馈,并将发现提炼回知识的循环,并在演讲中思考AI可以在哪些步骤上加速。他的答案基本上是几乎所有的步骤,包括最初提出任务本身。格林布拉特从回顾的角度也提出了类似的主张:过去两年强化学习环境的改进,主要是因为实验室学会了**构建什么**,并利用大量的AI劳动力来构建它。 来源:毕楚超的演讲(https://www.youtube.com/watch?v=E22AOHAEtu4&ref=mbi-deepdives.com) 来源:毕楚超的演讲(https://www.youtube.com/watch?v=E22AOHAEtu4&ref=mbi-deepdives.com) 格林布拉特另一个有趣的观察是,机器学习(ML)是一个相对于数学来说“浅薄”的领域,并且鉴于即使在数学领域,我们也在从“**证明稀缺的时代过渡到证明丰富的时代**(https://www.mbi-deepdives.com/proof/)”,自动化ML的大部分工作可能将证明是更容易实现的。格林布拉特认为: > “我认为ML相对于数学是一个非常浅薄的领域。在数学中,你更可能发现一些真正深刻的抽象概念,如果你真正理解了那个难以理解的东西,你就能取得进展。而我觉得ML中与之等价的东西都是非常愚蠢的废话。比如规模定律,拜托各位,我们很快就能解释规模定律。我认为数学中一些最深刻、最重要的概念,其特性在于你无法在短时间内真正理解其内涵及其重要性。我的感觉是,某些领域在运作方式和对深层抽象的依赖程度上存在结构性差异。物理学和数学更偏向于需要深刻、难以产生想法的一端,而我认为ML和大多数其他领域则更适合采用爬坡算法(https://en.wikipedia.org/wiki/Hill_climbing?ref=mbi-deepdives.com)。这是我对未来发展趋势的看法。即使在AI取得某些突破的情况下,回顾起来,实现这些突破的瓶颈往往在于掌握所有微观细节和模糊直觉。一个例子就是训练AI擅长推理和思维链(https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/?ref=mbi-deepdives.com),即对思维链进行强化学习。看起来,如果你真正将其规模化并做得足够好,你本可以在GPT-3上进行思维链强化学习,并在数学方面获得一些有趣的结果。” 毕还指出,在存在完美模拟器的地方(如编码、数学等),从环境交互中学习是高效的;而在模拟不可能或模拟与现实差距过大的地方(例如生物学和实验物理学),这种方法则根本行不通。考虑到这一背景,自动化AI研究似乎就不再那么天方夜谭了。 来源:毕楚超的演讲(https://www.youtube.com/watch?v=E22AOHAEtu4&ref=mbi-deepdives.com) 加文·贝克在最近对一位Anthropic研究员的回复(https://x.com/GavinSBaker/status/2088684251441254666?ref=mbi-deepdives.com)中提到:“我确实认为人类计算效率(老实说,我对你的大脑只靠15-20瓦功率运行印象深刻)意味着,*即使*在快速起飞、AGI至上的场景中,人类在可预见的未来仍具有经济价值。” 确实,人类的高效率也是毕在演讲中强调的重点(见下方相关幻灯片)。 来源:毕楚超的演讲(https://www.youtube.com/watch?v=E22AOHAEtu4&ref=mbi-deepdives.com) 来源:毕楚超的演讲(https://www.youtube.com/watch?v=E22AOHAEtu4&ref=mbi-deepdives.com) 来源:毕楚超的演讲(https://www.youtube.com/watch?v=E22AOHAEtu4&ref=mbi-deepdives.com) 然而,智人惊人的效率也是一个尖锐的提醒:大自然已经发布了一款通用智能,其运行功耗低于一个昏暗的灯泡。如今的模型通常需要一整栋楼的GPU和大部分互联网书面内容来完成更少的工作。这是否表明我们有什么“特殊”之处,还是衡量了我们当前方法效率低下的程度?毕的推测是,最大的浪费在于模型学习的**方式**。如果有人能解决这个问题,给定智能水平的成本可能会下降几个数量级。当然,我无法知道或预测这是否可以解决,或者如果可以,何时会发生。 最近,一位同行赞扬我通过我在MBI Deep Dives的工作帮助他提升了对AI领域的理解。我开玩笑地对他说,很高兴你这么觉得,但讽刺的是,我越是研究AI领域,就越确信自己需要对所有与AI相关的观点保持非常灵活的态度。这种心态在我心中很难激发信心,认为自己能看得很远。投资者正试图根据相关公司的近期轨迹来为AI领域定价,但考虑到AI领域的变化速度之快,很难不让人觉得,无论押注**支持还是反对**这场交易,都伴随着巨大的风险。 --- *订阅者可获取每日动态和五年以上的深度分析(Deep Dives),即对****65+*** (https://mbideepdives.substack.com/p/deep-dives)*家公司的完整分析报告,包含财务模型。每日动态只是我我在深度分析之间进行思考的记录!* --- **当前投资组合:** 请注意,这些**并非**我的买卖这些证券的建议,而只是我个人持仓的披露,以便您可以评估我可能存在的潜在偏见。请始终将我的文章视为我的个人投资日记,永远不要忘记我的目标、风险承受能力和约束可能与您毫无相似之处。 我的当前投资组合披露如下: #### 本文章仅限付费订阅者阅读 已有账户?请登录。

相似文章

泛滥时代的护城河(14分钟阅读)

TLDR AI

本文认为,充裕的AI智能不会消除商业护城河,而是会将价值转移至那些通过协调、工作流数据和结构性必要性将AI模型转化为现实成果的企业。

蒸馏护城河(6分钟阅读)

TLDR AI

文章认为,AI公司建立在昂贵模型训练之上的竞争护城河很容易被蒸馏(distillation)所削弱——即通过重复API查询来复制模型,行业实践如xAI在OpenAI模型上训练Grok、Anthropic指控中国实验室挖掘Claude等行为都印证了这一点。

Moats Need Models(6分钟阅读)

TLDR AI

本文认为,AI的可防御性来自于拥有完整的反馈循环——基于专有数据进行后训练的自定义模型,针对特定工作流进行调整,并由用户定义的标准进行评估——而不是从可能随时更改条款的供应商那里租用前沿API。它强调模型定制是实现差异化和利润控制的关键。