@Davidstout:一个月内下载量突破五十万。今天,我们的开源家族又迈出了新的一步。感谢大家难以置信的……
摘要
webAI 推出 TwIL-LM3-Pro,一款 36 亿参数的开源推理模型,可通过量化版本在日常电脑本地运行。在形式逻辑、SVAMP、MuSR 和 BIG-Bench Hard 等基准测试中,该模型在小型模型中取得最高分。他们还预告了 Meridian——即将推出的前沿级端侧模型系列。
查看缓存全文
缓存时间: 2026/10/01 08:20
一个月下载量突破五十万次。今天,我们的开源家族又迈出了重要一步。
感谢大家对第一代模型的大力支持。我们很高兴地推出 TwIL-LM3-Pro。
它仅有 36 亿参数,却能为日常电脑带来强大的推理能力,并提供可本地运行的量化版本。无需云端。
在我们的评测中:
**形式逻辑:**在对比的同类小模型中创下最高的公开成绩——比中国的 VibeThinker-3B 高出 35%,比 Qwen3.5-4B 高出 24%,比 Liquid AI 的 LFM2.5-8B-A1B 高出 47%。
**更广泛的推理能力:**在 SVAMP 上达到 95%,在 MuSR 上达到 64.1%,均为对比同类小模型中的最高公开成绩。
**BIG-Bench Hard 的逻辑子集:**95.4%,相比之下 VibeThinker-3B 为 61.1%。
我们认为,AI 正迈入后训练时代。未来的竞争优势将越来越属于拥有最佳流水线的公司,以及那些能够更快、更高效地生产出强大且个性化智能、并将其部署到人们现有设备上的公司。
这正是我们在 webAI 所做的事,而实验室中即将产出的成果,我们也才刚刚开始分享。
**即将推出:**Meridian——我们专为设备端运行打造的前沿级模型系列。我们最先进的模型将通过 @thewebAI 应用提供。
随着访问权限逐步开放,欢迎加入等候名单。自豪地打造于美国得克萨斯州奥斯汀。🇺🇸
相似文章
@rohanpaul_ai:中国最强的小型推理模型(VibeThinker-3B)刚刚被一个来自奥斯汀的 3.6B 模型击败。> webAI 的 TwIL-LM3-Pro…
webAI 发布了 TwIL-LM3-Pro,一个 3.66B 的开源推理模型,在形式逻辑基准测试上超越了 VibeThinker-3B、Qwen3.5-4B 和 LFM2.5-8B-A1B,并可通过 llama.cpp 以约 2 GiB 的 Q4 构建在本地运行。
@omarsar0:小型模型的推理能力正在变得非常强。这令人兴奋,因为 SLM 可以在 harness 层释放巨大潜力……
TheWebAI 发布了 TwIL-LM3-Pro,这是一个 3.6B 参数的开源 SLM,可本地运行,在 BIG-Bench Hard 上取得 95.4 分,超过 Qwen3-8B 的 63.7 分,其后训练流程包括形式逻辑微调、权重合并以及针对程序化验证器的强化学习。
@0xCodez:Andrej Karpathy 再次预言了 AI 的未来:“所有人都在租用前沿模型,而这些工作其实 3B 模型就能胜任……”
该帖子指出 Andrej Karpathy 的观点:小型 3B 模型可以替代前沿模型的调用,并介绍了 webAI 推出的开源推理模型 TwIL-LM3-Pro。这款拥有 36 亿参数的模型在形式逻辑任务上与 Qwen3-8B 表现相当,同时可以在 CPU 或 4GB 显存的本地设备上运行。
webAI发布了TwIL形式推理模型系列,如果您正在从事验证管道,值得关注。
webAI发布了TwIL形式推理模型系列,其中TwIL-LM3在特定基准测试中优于120B模型,同时体积更小40倍且效率更高。
@svpino:小巧、专业且开源的模型才是未来!TwiL-LM 模型系列现已在 HuggingFace 上发布,供 Tra…
TwiL-LM 是一系列小巧的专用开源模型,现已发布在 HuggingFace 上。其中 3B 版本在形式推理基准测试上优于 OpenAI 的 120B gpt-oss 模型,并且能在消费级硬件上高效运行。