1.7B模型在strict-7形式推理上超越Qwen3-8B和Gemma-4-26B - 专业模型蚕食通用模型领域?

Reddit r/artificial 模型

摘要

TwIL-LM2,一个专门针对形式逻辑翻译微调的1.7B模型,在严格评分基准上超越了更大的通用模型如Qwen3-8B和Gemma-4-26B,突显了专用AI模型在高效推理方面的潜力。

大型实验室的大部分推理提升仍然与规模相关。更多参数,更多计算,更好的推理。这一直是长久以来的策略。遇到了TwIL-LM2,它在狭窄任务上改变了规则。基于SmolLM2-1.7B的PEFT LoRA适配器,专门用于形式逻辑翻译。在strict-7评分(无部分分数,要求精确格式)上,它得到0.2386 - 领先于Qwen3-8B的0.2093和Gemma-4-26B的0.2050。在宽松匹配六车道平均上,情况不同(Qwen3-8B仍然获胜),但对于“实际可用的形式输出”测量,1.7B模型领先。这让我思考,“我们需要更大模型进行推理”的叙述有多少实际上是关于复杂多步骤推理,而不是仅仅有足够的容量来容纳多种方法。如果你能在一个推理任务上高度专门化,并在最严格评分上以1.7B模型领先8B+模型,那就是真正的效率。有点希望这能成为趋势。一个由1-3B模型的狭窄专家组成的流水线听起来比将所有内容路由到70B模型更实用。非商业许可,值得指出。有人在使用类似的狭窄微调吗?你发现哪些任务对这种方法响应良好?
查看原文

相似文章

Qwen3.5 122B 是最好的吗?

Reddit r/LocalLLaMA

一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。

不流行观点:Qwen 3.8 27b 不是过度思考者

Reddit r/LocalLLaMA

文章认为,Qwen 3.8 27b 增加的推理令牌使用量与其他中国AI模型如 GLM 和 DeepSeek 相似,用户的挫败感源于硬件限制。它建议使用推理预算可以保持性能优于 Qwen 3.6。

用于小型语言模型算术微调的结构化合成推理数据

arXiv cs.AI

本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。