@0xCodez:Andrej Karpathy 再次预言了 AI 的未来:“所有人都在租用前沿模型,而这些工作其实 3B 模型就能胜任……”
摘要
该帖子指出 Andrej Karpathy 的观点:小型 3B 模型可以替代前沿模型的调用,并介绍了 webAI 推出的开源推理模型 TwIL-LM3-Pro。这款拥有 36 亿参数的模型在形式逻辑任务上与 Qwen3-8B 表现相当,同时可以在 CPU 或 4GB 显存的本地设备上运行。
查看缓存全文
缓存时间: 2026/10/03 04:51
Andrej Karpathy 再次预言了 AI 的未来:
“每个人都在为那些 3B 模型就能完成的工作租赁前沿大模型。小型模型才是未来。”
这份 18 页的 PDF 详细阐述了 Karpathy 关于使用小型 LLM 的核心论点。
真正的问题不是“小模型的效果一样好吗?”而是“我的 1,000 次调用中,究竟有几次真的需要前沿大模型?”
而 @thewebai 已经在形式逻辑领域给出了答案。
TwIL-LM3-Pro: → 3.6B 参数,在形式逻辑上与 Qwen3-8B 不相上下 → 在全部 6 项形式逻辑任务上领先 VibeThinker-3B → BBH 逻辑 95.4%,SVAMP 95% → Q4 量化后仅 2.09 GiB,CPU 或 4GB 显存即可运行 → 无需 API 费用,数据不出本机
秘诀不在规模,而在后训练。
PDF 在下方。模型 👇 http://huggingface.co/webAI-Official/TwIL-LM3-Pro…
David Stout (@Davidstout): 一个月内下载量突破五十万。今天,我们的开源家族又向前迈进了一步。
感谢大家对我们第一代模型的鼎力支持。我们很高兴地推出 TwIL-LM3-Pro。
仅有 36 亿参数,它便将强大的推理能力带到了
相似文章
@rohanpaul_ai:中国最强的小型推理模型(VibeThinker-3B)刚刚被一个来自奥斯汀的 3.6B 模型击败。> webAI 的 TwIL-LM3-Pro…
webAI 发布了 TwIL-LM3-Pro,一个 3.66B 的开源推理模型,在形式逻辑基准测试上超越了 VibeThinker-3B、Qwen3.5-4B 和 LFM2.5-8B-A1B,并可通过 llama.cpp 以约 2 GiB 的 Q4 构建在本地运行。
@omarsar0:小型模型的推理能力正在变得非常强。这令人兴奋,因为 SLM 可以在 harness 层释放巨大潜力……
TheWebAI 发布了 TwIL-LM3-Pro,这是一个 3.6B 参数的开源 SLM,可本地运行,在 BIG-Bench Hard 上取得 95.4 分,超过 Qwen3-8B 的 63.7 分,其后训练流程包括形式逻辑微调、权重合并以及针对程序化验证器的强化学习。
@andrewchen: “不要赌AI模型不会随时间大幅进步”曾经是你在支持前沿实验室时说的话…
Andrew Chen 认为,开放权重AI模型正在快速进步,并将覆盖大多数消费者/专业消费者用例,而前沿模型则只能竞争剩余高价值的10%应用领域,例如编程、科学和数学。
@Davidstout:一个月内下载量突破五十万。今天,我们的开源家族又迈出了新的一步。感谢大家难以置信的……
webAI 推出 TwIL-LM3-Pro,一款 36 亿参数的开源推理模型,可通过量化版本在日常电脑本地运行。在形式逻辑、SVAMP、MuSR 和 BIG-Bench Hard 等基准测试中,该模型在小型模型中取得最高分。他们还预告了 Meridian——即将推出的前沿级端侧模型系列。
@Zephyr_hg: UC伯克利刚刚开源了一款可以在游戏PC上运行的前沿级AI。模型变得越来越便宜、快速、开源。A…
UC伯克利开源了一款可以在游戏PC上运行的前沿级AI模型,使得高级AI更易获取和负担得起,焦点转向用户设置以实现实际工作。