@omarsar0:小型模型的推理能力正在变得非常强。这令人兴奋,因为 SLM 可以在 harness 层释放巨大潜力……

X AI KOLs Timeline 模型

摘要

TheWebAI 发布了 TwIL-LM3-Pro,这是一个 3.6B 参数的开源 SLM,可本地运行,在 BIG-Bench Hard 上取得 95.4 分,超过 Qwen3-8B 的 63.7 分,其后训练流程包括形式逻辑微调、权重合并以及针对程序化验证器的强化学习。

小型模型的推理能力正在变得非常强。 这令人兴奋,因为 SLM 可以在 harness 层释放巨大潜力。 来自 @thewebAI 的 TwIL-LM3-Pro 拥有 3.6B 参数,可在日常电脑上本地运行。它在 BIG-Bench Hard 上取得 95.4 分,远超 Qwen3-8B 的 63.7 分。 我很欣赏他们的后训练配方:先在形式逻辑上进行微调,然后将权重向基础模型方向回合并,最后针对程序化验证器进行强化学习。逻辑得分显著提升,同时通用推理能力保持稳定。 很高兴看到更多这样的工作以开源形式发布。
查看原文
查看缓存全文

缓存时间: 2026/10/02 06:36

小模型在推理能力上变得越来越强了。

这让人很兴奋,因为 SLM 能在框架层(harness 层)带来如此多的可能性。

来自 @thewebAI 的 TwIL-LM3-Pro 只有 3.6B 参数,可以在日常电脑上本地运行。它在 BIG-Bench Hard 上取得了 95.4 分,大幅领先于 Qwen3-8B 的 63.7 分。

我很喜欢他们的后训练方案:先在形式逻辑数据上微调,再把权重合并回向基础模型,最后用程序化验证器进行 RL 训练。逻辑分数提升了,通用推理能力也保持稳定。

很高兴看到更多这样的工作以开源形式发布。

David Stout (@Davidstout): 一个月内下载量突破五十万。今天,我们的开源家族又向前迈进了一步。

感谢大家对第一代模型的鼎力支持。我们很高兴推出 TwIL-LM3-Pro。

仅仅拥有 36 亿参数,它就将强大的推理能力带入……

相似文章