@rohanpaul_ai:中国最强的小型推理模型(VibeThinker-3B)刚刚被一个来自奥斯汀的 3.6B 模型击败。> webAI 的 TwIL-LM3-Pro…
摘要
webAI 发布了 TwIL-LM3-Pro,一个 3.66B 的开源推理模型,在形式逻辑基准测试上超越了 VibeThinker-3B、Qwen3.5-4B 和 LFM2.5-8B-A1B,并可通过 llama.cpp 以约 2 GiB 的 Q4 构建在本地运行。
查看缓存全文
缓存时间: 2026/10/01 12:22
中国最强的轻量推理模型(VibeThinker-3B)刚刚被一个来自奥斯汀的 3.6B 模型击败。
webAI 的 TwIL-LM3-Pro 是一个 3.66B 参数的本地模型,将 IBM Granite 的形式逻辑得分提升了 28%
推荐的 Q4 版本文件大小为 2.09GiB,可通过 llama.cpp 在 CPU 或本地 GPU 上运行,因此隐私数据可以保留在设备本地。
TwIL-LM3-Pro 在形式逻辑测试中领先 webAI 对比过的所有小型模型,得分比微博的 VibeThinker-3B 高约 35%,比 Qwen3.5-4B 高 24%,比 Liquid AI 的 LFM2.5-8B-A1B 高 47%。
David Stout (@Davidstout): 一个月内下载量达到五十万次。今天,我们的开源模型家族又向前迈进了一步。
感谢大家对我们第一代模型的鼎力支持。我们很高兴正式推出 TwIL-LM3-Pro。
它仅有 30 亿参数,便能提供强大的推理能力……
相似文章
@aijoey: WeiboAI 发布了 VibeThinker-3B,所以我必须在本地尝试一下。这是一个 3B 模型,不是大型前沿系统。在视频中…
WeiboAI 发布了 VibeThinker-3B,一个在本地测试编码任务的小型 3B 推理模型,在算法问题上取得了 3/3 的成绩。
@0xCodez:Andrej Karpathy 再次预言了 AI 的未来:“所有人都在租用前沿模型,而这些工作其实 3B 模型就能胜任……”
该帖子指出 Andrej Karpathy 的观点:小型 3B 模型可以替代前沿模型的调用,并介绍了 webAI 推出的开源推理模型 TwIL-LM3-Pro。这款拥有 36 亿参数的模型在形式逻辑任务上与 Qwen3-8B 表现相当,同时可以在 CPU 或 4GB 显存的本地设备上运行。
@omarsar0:小型模型的推理能力正在变得非常强。这令人兴奋,因为 SLM 可以在 harness 层释放巨大潜力……
TheWebAI 发布了 TwIL-LM3-Pro,这是一个 3.6B 参数的开源 SLM,可本地运行,在 BIG-Bench Hard 上取得 95.4 分,超过 Qwen3-8B 的 63.7 分,其后训练流程包括形式逻辑微调、权重合并以及针对程序化验证器的强化学习。
为什么微博的迷你VibeThinker-3B再次引发AI界关于基准测试的争论(15分钟阅读)
微博的VibeThinker-3B,一个3B参数模型,声称在数学和编程基准测试中匹配或超越DeepSeek V3.2和Gemini 3 Pro等更大模型的推理性能,引发了关于基准测试可靠性和扩展必要性的争论。
@Davidstout:一个月内下载量突破五十万。今天,我们的开源家族又迈出了新的一步。感谢大家难以置信的……
webAI 推出 TwIL-LM3-Pro,一款 36 亿参数的开源推理模型,可通过量化版本在日常电脑本地运行。在形式逻辑、SVAMP、MuSR 和 BIG-Bench Hard 等基准测试中,该模型在小型模型中取得最高分。他们还预告了 Meridian——即将推出的前沿级端侧模型系列。