@svpino:这个开源模型仅用 3.66B 参数就在 BIG-Bench Hard 逻辑子集上拿下 95.4%。TwIL-LM3-Pro 是一个……
摘要
TwIL-LM3-Pro 是一个 3.66B 参数的开源模型,在 BIG-Bench Hard 逻辑子集上取得 95.4% 的成绩,体积小到可以直接在笔记本电脑本地运行,展示了针对特定任务的小模型进行专业化后训练的强大威力。
查看缓存全文
缓存时间: 2026/10/01 06:20
这个开源模型在 BIG-Bench Hard 的逻辑子集上得分 95.4%,参数量仅有 3.66B。
TwIL-LM3-Pro 小到可以在笔记本上本地运行。
专门化的后训练真的很酷。当你聚焦于特定任务时,可以得到大量小模型。 https://t.co/EwqiKKbr3t
David Stout (@Davidstout): 一个月内下载量达到五十万。今天,我们的开源家族又向前迈进了一步。
感谢大家对我们第一代模型的大力支持。我们很高兴推出 TwIL-LM3-Pro。
它仅拥有 36 亿参数,却带来了强大的推理能力
相似文章
@omarsar0:小型模型的推理能力正在变得非常强。这令人兴奋,因为 SLM 可以在 harness 层释放巨大潜力……
TheWebAI 发布了 TwIL-LM3-Pro,这是一个 3.6B 参数的开源 SLM,可本地运行,在 BIG-Bench Hard 上取得 95.4 分,超过 Qwen3-8B 的 63.7 分,其后训练流程包括形式逻辑微调、权重合并以及针对程序化验证器的强化学习。
@svpino:小巧、专业且开源的模型才是未来!TwiL-LM 模型系列现已在 HuggingFace 上发布,供 Tra…
TwiL-LM 是一系列小巧的专用开源模型,现已发布在 HuggingFace 上。其中 3B 版本在形式推理基准测试上优于 OpenAI 的 120B gpt-oss 模型,并且能在消费级硬件上高效运行。
@Davidstout:一个月内下载量突破五十万。今天,我们的开源家族又迈出了新的一步。感谢大家难以置信的……
webAI 推出 TwIL-LM3-Pro,一款 36 亿参数的开源推理模型,可通过量化版本在日常电脑本地运行。在形式逻辑、SVAMP、MuSR 和 BIG-Bench Hard 等基准测试中,该模型在小型模型中取得最高分。他们还预告了 Meridian——即将推出的前沿级端侧模型系列。
@rohanpaul_ai:中国最强的小型推理模型(VibeThinker-3B)刚刚被一个来自奥斯汀的 3.6B 模型击败。> webAI 的 TwIL-LM3-Pro…
webAI 发布了 TwIL-LM3-Pro,一个 3.66B 的开源推理模型,在形式逻辑基准测试上超越了 VibeThinker-3B、Qwen3.5-4B 和 LFM2.5-8B-A1B,并可通过 llama.cpp 以约 2 GiB 的 Q4 构建在本地运行。
MiniCPM5-1B 表明小模型竞赛尚未结束
MiniCPM5-1B 是 OpenBMB 推出的一个拥有 10 亿参数的模型,在 AIME 2025 和 τ2-Bench Telecom 上取得了令人瞩目的成绩,超越了更大的模型。它从单个检查点同时提供快速模式和推理模式,这得益于包括监督微调、强化学习和在线策略蒸馏在内的三阶段后训练过程。