@omarsar0:小型模型的推理能力正在变得非常强。这令人兴奋,因为 SLM 可以在 harness 层释放巨大潜力……
摘要
TheWebAI 发布了 TwIL-LM3-Pro,这是一个 3.6B 参数的开源 SLM,可本地运行,在 BIG-Bench Hard 上取得 95.4 分,超过 Qwen3-8B 的 63.7 分,其后训练流程包括形式逻辑微调、权重合并以及针对程序化验证器的强化学习。
查看缓存全文
缓存时间: 2026/10/02 06:36
小模型在推理能力上变得越来越强了。
这让人很兴奋,因为 SLM 能在框架层(harness 层)带来如此多的可能性。
来自 @thewebAI 的 TwIL-LM3-Pro 只有 3.6B 参数,可以在日常电脑上本地运行。它在 BIG-Bench Hard 上取得了 95.4 分,大幅领先于 Qwen3-8B 的 63.7 分。
我很喜欢他们的后训练方案:先在形式逻辑数据上微调,再把权重合并回向基础模型,最后用程序化验证器进行 RL 训练。逻辑分数提升了,通用推理能力也保持稳定。
很高兴看到更多这样的工作以开源形式发布。
David Stout (@Davidstout): 一个月内下载量突破五十万。今天,我们的开源家族又向前迈进了一步。
感谢大家对第一代模型的鼎力支持。我们很高兴推出 TwIL-LM3-Pro。
仅仅拥有 36 亿参数,它就将强大的推理能力带入……
相似文章
@svpino:这个开源模型仅用 3.66B 参数就在 BIG-Bench Hard 逻辑子集上拿下 95.4%。TwIL-LM3-Pro 是一个……
TwIL-LM3-Pro 是一个 3.66B 参数的开源模型,在 BIG-Bench Hard 逻辑子集上取得 95.4% 的成绩,体积小到可以直接在笔记本电脑本地运行,展示了针对特定任务的小模型进行专业化后训练的强大威力。
@rohanpaul_ai:中国最强的小型推理模型(VibeThinker-3B)刚刚被一个来自奥斯汀的 3.6B 模型击败。> webAI 的 TwIL-LM3-Pro…
webAI 发布了 TwIL-LM3-Pro,一个 3.66B 的开源推理模型,在形式逻辑基准测试上超越了 VibeThinker-3B、Qwen3.5-4B 和 LFM2.5-8B-A1B,并可通过 llama.cpp 以约 2 GiB 的 Q4 构建在本地运行。
@svpino:小巧、专业且开源的模型才是未来!TwiL-LM 模型系列现已在 HuggingFace 上发布,供 Tra…
TwiL-LM 是一系列小巧的专用开源模型,现已发布在 HuggingFace 上。其中 3B 版本在形式推理基准测试上优于 OpenAI 的 120B gpt-oss 模型,并且能在消费级硬件上高效运行。
@Davidstout:一个月内下载量突破五十万。今天,我们的开源家族又迈出了新的一步。感谢大家难以置信的……
webAI 推出 TwIL-LM3-Pro,一款 36 亿参数的开源推理模型,可通过量化版本在日常电脑本地运行。在形式逻辑、SVAMP、MuSR 和 BIG-Bench Hard 等基准测试中,该模型在小型模型中取得最高分。他们还预告了 Meridian——即将推出的前沿级端侧模型系列。
@cjzafir: 垂直语言模型(VLMs)正在击败顶级大语言模型。这些参数量7B到15B的小型专精模型在各自的细分领域击败了SoTA模型……
作者演示了,通过使用开源模型和Codex编排进行高性价比微调,小型垂直语言模型(6B-15B)能够在细分基准上超越顶级大语言模型,仅用价值300美元的数据集就取得了成果。