@_jasonwei: 当语言模型首次开始良好使用工具时,我曾同情那种认为无需扩大语言模型规模(lang…)的叙述。
摘要
作者认为,虽然工具使用使较小的语言模型能够有效执行任务,但较大的模型在速度、可靠性和内化知识方面仍然至关重要,强调在人工智能领域持续扩展规模的必要性。
查看缓存全文
缓存时间: 2026/08/17 20:20
当语言模型刚开始擅长使用工具时,我曾认同这样一种观点:与其扩大语言模型规模,不如打造一个足够强大的“认知核心”(比如10亿参数),其余工作交由工具完成——无论是浏览互联网还是执行代码。我认为许多人都认同这个观点,因为确实很难想到一个10亿模型通过工具辅助仍无法完成的重要任务。例如,大型语言模型知晓的任何冷门知识,理论上都可以通过互联网检索后交由10亿参数模型处理。
但现在我认为这完全错误,原因很简单:不依赖工具快速自然地完成任务至关重要。
我领悟这一点的契机来自今年学习羽毛球的经历。在球场上,我就像一个“10亿认知核心”:虽然能物理复现教练教授的每个击球动作,但需要耗费大量脑力记忆每个要领并串联执行。实战中我或许能近乎完美地完成单个动作,却难以在连续对打中保持水准,更无法在比赛中稳定发挥。这显然不同于那些将击球训练过万遍、将技术化为本能反应的人。
同理,语言模型通过自身参数(而非工具调用)掌握知识具有重要价值。首要原因是速度优势:我们显然更希望即时获得答案,而非等待模型长时间推演或联网检索。第二,某些知识本就适合通过海量数据的反向传播来内化。例如当询问“人们对香巴拉音乐节的普遍看法”时,我们更希望获得基于全网数据的综合评价,而非搜索引擎前三条结果的机械复述。第三,自主检索答案的可靠性往往低于模型已内化的知识。尽管这并非绝对,但至少当前如此——频繁重新检索事实或重演数学推导过程必然增加出错概率,而长任务链中的误差会产生累积效应。
一旦承认无需工具的参数化处理具有价值,就必须接受10亿认知核心不足的结论。10亿参数模型的内部信息承载存在上限,而我们必然期望人工智能掌握更多知识。即便万亿参数可能仍不够——我们将追求AI尽可能了解世界,保持信息更新,且对AI能力的期待只会持续增长。
总而言之,工具使用让小模型实现更多可能,但追求顶尖智能的人永远需要更大规模的模型。“苦涩的教训”再次应验。
相似文章
神经语言模型的缩放规律
基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。
大小真的重要吗?(LLMs vs. SLMs)
讨论了大语言模型(LLMs)与小语言模型(SLMs)之间的权衡,质疑在生产用例中是否总是需要更大的模型,并探讨了AI部署的未来。
@datologyai:为什么更大的模型能保留稀有技能而较小模型会失去?Jing Huang(斯坦福 NLP)指出干扰……
这篇文章讨论了斯坦福 NLP 的 Jing Huang 在 Summer of Data 活动中的演讲,解释了更大的 AI 模型由于任务干扰和更大的容量而能更好地保留稀有技能。
论大型语言模型缩放指数的微小性
本文讨论了大型语言模型的小缩放指数,认为它们在能源资源方面指示了一种不可持续的状态。还探讨了'pedestal effect',并类比流体湍流以评论数据的平滑性。
@rohanpaul_ai: 更强的AI智能体不仅来自更大的模型,更来自围绕它们的更优系统。问题在于,许多AI…
该推文讨论了论文《从模型规模化到系统规模化》,该论文认为,更强大的AI智能体需要更好的系统设计(框架),包括上下文控制、记忆和路由,而不仅仅是更大的模型。