@0xCodez:Andrej Karpathy 再次预言了 AI 的未来:“所有人都在租用前沿模型,而这些工作其实 3B 模型就能胜任……”

X AI KOLs Timeline 模型

摘要

该帖子指出 Andrej Karpathy 的观点:小型 3B 模型可以替代前沿模型的调用,并介绍了 webAI 推出的开源推理模型 TwIL-LM3-Pro。这款拥有 36 亿参数的模型在形式逻辑任务上与 Qwen3-8B 表现相当,同时可以在 CPU 或 4GB 显存的本地设备上运行。

Andrej Karpathy 再次预言了 AI 的未来: “所有人都在租用前沿模型,而这些工作其实 3B 模型就能胜任……小型模型才是未来。” 这份 18 页的 PDF 深入剖析了 Karpathy 关于使用小型 LLM 的论点。 真正的问题不是“小模型的性能够不够好?”,而是“我那 1000 次调用中,究竟哪一次真的需要前沿模型?” 而 @thewebai 刚刚在形式逻辑领域给出了答案。 TwIL-LM3-Pro: → 36 亿参数,在形式逻辑任务上与 Qwen3-8B 旗鼓相当 → 在所有 6 项形式逻辑测试任务上均超越 VibeThinker-3B → BBH 逻辑任务达到 95.4%,SVAMP 达到 95% → Q4 量化后仅 2.09 GiB,可在 CPU 或 4GB 显存上运行 → 无需 API 计费,数据不会离开你的设备 秘诀不在于模型大小,而在于后训练(post-training)。 PDF 链接见下方。模型 👇 http://huggingface.co/webAI-Official/TwIL-LM3-Pro…
查看原文
查看缓存全文

缓存时间: 2026/10/03 04:51

Andrej Karpathy 再次预言了 AI 的未来:

“每个人都在为那些 3B 模型就能完成的工作租赁前沿大模型。小型模型才是未来。”

这份 18 页的 PDF 详细阐述了 Karpathy 关于使用小型 LLM 的核心论点。

真正的问题不是“小模型的效果一样好吗?”而是“我的 1,000 次调用中,究竟有几次真的需要前沿大模型?”

而 @thewebai 已经在形式逻辑领域给出了答案。

TwIL-LM3-Pro: → 3.6B 参数,在形式逻辑上与 Qwen3-8B 不相上下 → 在全部 6 项形式逻辑任务上领先 VibeThinker-3B → BBH 逻辑 95.4%,SVAMP 95% → Q4 量化后仅 2.09 GiB,CPU 或 4GB 显存即可运行 → 无需 API 费用,数据不出本机

秘诀不在规模,而在后训练。

PDF 在下方。模型 👇 http://huggingface.co/webAI-Official/TwIL-LM3-Pro…

David Stout (@Davidstout): 一个月内下载量突破五十万。今天,我们的开源家族又向前迈进了一步。

感谢大家对我们第一代模型的鼎力支持。我们很高兴地推出 TwIL-LM3-Pro。

仅有 36 亿参数,它便将强大的推理能力带到了

相似文章