@_jasonwei: 当语言模型首次开始良好使用工具时,我曾同情那种认为无需扩大语言模型规模(lang…)的叙述。

X AI KOLs Timeline 新闻

摘要

作者认为,虽然工具使用使较小的语言模型能够有效执行任务,但较大的模型在速度、可靠性和内化知识方面仍然至关重要,强调在人工智能领域持续扩展规模的必要性。

当语言模型首次开始良好使用工具时,我曾同情那种认为无需扩大语言模型规模,只需一个足够强大的“认知核心”,比如10亿参数,其他任何事情都可以通过工具使用来完成,比如浏览互联网或执行代码。我认为很多人都同意这个论点,而且确实很难想出一项有意义的任务,原则上无法通过一个拥有充分工具访问权限的10亿参数模型来完成。例如,大型语言模型可能知道的任何深奥事实,原则上都可以从互联网上检索,并由一个10亿参数语言模型进行推理。 然而,我现在认为这完全错误,原因很简单:无需工具使用就能快速自然地完成任务非常重要。 我内化这个原因的方式实际上是在今年学习羽毛球的个人旅程中。在羽毛球中,我非常像一个“10亿参数认知核心”。虽然我可以在身体上做到教练教我的每一个击球动作,但在心理上记住每一个提示并将其组合起来需要大量努力。实际上,我几乎可以完美地完成一次击球,但在整个回合中我很难做到,而且在比赛中肯定无法稳定地做到。这显然与那些将一个击球练习了一万次,并毫不费力地将其作为自然本能执行的人不同。 同样,语言模型内部知道一个事实,无需工具调用,是有意义的。第一个原因是我们显然关心速度;你宁愿立即得到答案,也不愿让模型思考很长时间以确保答案正确或浏览网页。第二个原因是有些事情最好通过大量数据的反向传播来学习。如果你询问人们对Shambhala音乐节的看法,你宁愿大型语言模型基于互联网上的所有数据给出一个综合意见,也不愿得到网络搜索中出现的前三个评论的重复。第三个原因是,必须做大量工作来寻找答案不如已经知道答案可靠。虽然理论上这不一定成立,但实践中可能成立,至少目前如此。如果必须不断重新查找事实或重新进行数学推导,出错的可能性更高,这在长程任务中可能会累积。 一旦你认同无需工具使用就能参数化地完成任务是有价值的,那么你就必须认同10亿参数认知核心不足的论点。10亿参数模型能够内化的知识量存在信息限制,我们当然希望人工智能知道更多。即使是1万亿参数可能也不够。我们将希望人工智能尽可能多地了解我们的世界,希望它随着新信息而更新,我们对人工智能能为我们做什么的期望将继续增长。 总之,工具使用使小型模型能够做更多事情,但那些要求最高质量智能的人总是会想要更大的模型。苦涩的教训再次显现。
查看原文
查看缓存全文

缓存时间: 2026/08/17 20:20

当语言模型刚开始擅长使用工具时,我曾认同这样一种观点:与其扩大语言模型规模,不如打造一个足够强大的“认知核心”(比如10亿参数),其余工作交由工具完成——无论是浏览互联网还是执行代码。我认为许多人都认同这个观点,因为确实很难想到一个10亿模型通过工具辅助仍无法完成的重要任务。例如,大型语言模型知晓的任何冷门知识,理论上都可以通过互联网检索后交由10亿参数模型处理。

但现在我认为这完全错误,原因很简单:不依赖工具快速自然地完成任务至关重要

我领悟这一点的契机来自今年学习羽毛球的经历。在球场上,我就像一个“10亿认知核心”:虽然能物理复现教练教授的每个击球动作,但需要耗费大量脑力记忆每个要领并串联执行。实战中我或许能近乎完美地完成单个动作,却难以在连续对打中保持水准,更无法在比赛中稳定发挥。这显然不同于那些将击球训练过万遍、将技术化为本能反应的人。

同理,语言模型通过自身参数(而非工具调用)掌握知识具有重要价值。首要原因是速度优势:我们显然更希望即时获得答案,而非等待模型长时间推演或联网检索。第二,某些知识本就适合通过海量数据的反向传播来内化。例如当询问“人们对香巴拉音乐节的普遍看法”时,我们更希望获得基于全网数据的综合评价,而非搜索引擎前三条结果的机械复述。第三,自主检索答案的可靠性往往低于模型已内化的知识。尽管这并非绝对,但至少当前如此——频繁重新检索事实或重演数学推导过程必然增加出错概率,而长任务链中的误差会产生累积效应。

一旦承认无需工具的参数化处理具有价值,就必须接受10亿认知核心不足的结论。10亿参数模型的内部信息承载存在上限,而我们必然期望人工智能掌握更多知识。即便万亿参数可能仍不够——我们将追求AI尽可能了解世界,保持信息更新,且对AI能力的期待只会持续增长。

总而言之,工具使用让小模型实现更多可能,但追求顶尖智能的人永远需要更大规模的模型。“苦涩的教训”再次应验

相似文章

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

大小真的重要吗?(LLMs vs. SLMs)

Reddit r/artificial

讨论了大语言模型(LLMs)与小语言模型(SLMs)之间的权衡,质疑在生产用例中是否总是需要更大的模型,并探讨了AI部署的未来。

论大型语言模型缩放指数的微小性

arXiv cs.AI

本文讨论了大型语言模型的小缩放指数,认为它们在能源资源方面指示了一种不可持续的状态。还探讨了'pedestal effect',并类比流体湍流以评论数据的平滑性。