@cjzafir:Qwen 3.5 4B 和 8B 模型太棒了。我今天微调了一个 4B 模型,在全精度和 Q8 量化版本上达到了 98% 的准确率…
摘要
一位开发者报告称,使用 Unsloth 微调 Qwen 3.5 4B 和 8B 模型后取得了高准确率,这表明业界正转向针对细分任务使用专用的专家语言模型(ELMs)。
Qwen 3.5 4B 和 8B 模型实在太强了。我今天微调了一个 4B 模型,在全精度和 Q8 量化版本上均达到了 98% 的准确率。即便是 Q4 量化版本,质量损失也仅为 1%。我的技术栈如下:
> Codex 5.5 作为规划/协调器
> Deepseek v4 pro 生成示例
> Collab pro 提供 A100 GPU
> Unsloth 提供微调方案
随后 Codex 运行了 8-9 个小时以完成各个阶段:
- 基础架构清晰化
- 数据集创建
- 质量门控
- 微调
- 运行评估
- 量化
- 测试/报告
有时让人觉得有趣的是,如今微调 5B 到 10B 参数规模的模型变得如此容易,并且在特定细分环境中能够击败二线最先进(SoTA)模型。我拥有能够轻松超越 Gemini 3 pro、Sonnet 4.6、GPT-4.5 mini 的模型。现在我们正转向使用专家语言模型(ELMs),而不是将所有任务都扔给大型语言模型(LLMs)。毕竟你不会到处都开保时捷!为企业打造“凯美瑞”,才能赚到钱。
相似文章
Qwen3.5 122B 是最好的吗?
一位用户分享了他们在复杂工具调用任务中比较多个大语言模型(Qwen、Gemma)的经验,认为 Qwen3.5 122B 最可靠,同时批评了较小的 MoE 模型不稳定。
对本地LLM如Qwen 3:0.6B进行微调以对问题分类,效果良好
一位开发者使用Unsloth框架对小型Qwen 3 0.6B模型进行微调,用于对家庭问题进行分类,仅用850个训练样本便取得了良好效果。
@xdotli: 我的朋友 @xeophon 认为编码问题已经解决了,这里有一个验证:一个3B模型接受了以算法效率为重点的训练……
Nanbeige 4.1,一个3B模型,在编码任务中专注于算法效率,超越了Qwen3-30b-A3b和Qwen 3.5 4b,实现了600多次工具调用的长时任务。
Qwen 3.8 27B 发布:开放权重,目前最好的本地稠密模型
Qwen 发布了 Qwen3.8-27B,这是一个开放权重的 27B 稠密视觉语言模型,在编程、专业工作和长周期智能体任务上取得了重大进展,提供 FP8 版本并支持灵活的思考控制。
@no_stp_on_snek: Qwen3.8 27B 概览。版本 3.6:退步:* 偏见/公平性 * 配置易用性 增强:* 核心 * 能力 结论…
本文评估了Qwen3.8 27B AI模型的3.6版本,强调了在偏见/公平性和配置易用性方面的退步,同时指出了在核心和能力方面的改进,得出结论:这不是一次干净的升级。