@LangChain: 微调开源模型可以超越或匹配前沿模型。基础 @Alibaba_Qwen 开箱即有良好的提示能力:强…
摘要
使用LoRA微调像阿里巴巴Qwen这样的开源模型,可以在错误分类任务上匹配或超越前沿模型性能。
查看缓存全文
缓存时间: 2026/06/17 19:59
微调开源模型可以超越或匹配前沿模型。
📦 使用 @Alibaba_Qwen 的基础模型,配合良好的提示词:
在感知误差分类方面表现强劲,接近前沿模型性能。
🔧 通过 LoRA SFT 微调:
两个模型都接近或超越了前沿模型表现。https://t.co/U3FmwCmskl
相似文章
@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-Max,一个2.4万亿参数模型,每个token仅激活约950亿参数。一个……
阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。
@Vtrivedy10: https://x.com/Vtrivedy10/status/2066571435871551655
LangChain Labs与Fireworks AI联合研究表明,通过微调开源Qwen模型,可以创建一个能够检测生产轨迹中“感知错误”的轨迹判断器,且该模型在以最高降低100倍成本的同时达到前沿性能。该模型在两个内部数据集上进行了评估,并显示出跨应用的通用性。
@cjzafir:Qwen 3.5 4B 和 8B 模型太棒了。我今天微调了一个 4B 模型,在全精度和 Q8 量化版本上达到了 98% 的准确率…
一位开发者报告称,使用 Unsloth 微调 Qwen 3.5 4B 和 8B 模型后取得了高准确率,这表明业界正转向针对细分任务使用专用的专家语言模型(ELMs)。
@malikwas1f: 首次对 @Alibaba_Qwen qwen 3.6 27b 进行微调以提升其质量。@migtissera https://github.com/noonghunn…
宣布首次微调阿里巴巴 Qwen 3.6 27B 以提升其质量,并附有一个 GitHub 仓库(club-3090),提供在 RTX 3090 上本地运行大型语言模型的指南。
@cline: 祝贺@Alibaba_Qwen团队,新的Qwen-3.7 Plus是一款同类最佳的多模态模型,表现接近SOTA……
Qwen-3.7 Plus是阿里巴巴Qwen推出的新多模态模型,作为编码和通用代理的表现接近最先进水平;现在可以在Cline中免费试用。