我使用强化学习训练了Qwen3.6-35B-A3B,用于强化学习训练小型任务专用Qwen模型。完全开源!🤓
摘要
作者使用强化学习训练了Qwen3.6-35B-A3B模型,然后用于强化学习训练小型任务专用Qwen模型,并且完全开源了所有内容。
暂无内容
相似文章
训练前沿知识工作代理:使用SkyRL的397B强化学习训练指南(18分钟阅读)
Mercor详细介绍了Qwen3.5-397B-A17B和Qwen3.6-35B-A3B针对知识工作代理的强化学习后训练,在APEX-Agents基准上实现了70%的相对改进,并开源了完整的训练配方。
Qwen 3.8 27B 发布:开放权重,目前最好的本地稠密模型
Qwen 发布了 Qwen3.8-27B,这是一个开放权重的 27B 稠密视觉语言模型,在编程、专业工作和长周期智能体任务上取得了重大进展,提供 FP8 版本并支持灵活的思考控制。
Qwen 3.7 Max
Qwen 3.7 是一款来自中国实验室的新AI模型,令人印象深刻,讨论焦点在于其权重是否可供下载。
@sgl_project: 小型模型之王回归了!来自@Alibaba_Qwen的Qwen3.8-27B已经开源,SGLang已经实现了首日支持:-…
Qwen3.8-27B,一个来自阿里巴巴的270亿参数多模态AI模型,现在已经开源,并在SGLang中提供了首日支持,提供高推理速度和在编码与办公任务上的卓越性能。
Qwen永远不会开源Qwen 3.7了,对吧?
在解雇Junyang Lin之后,Qwen锁定了其大型模型,不再发布开源模型,而其他中国AI实验室继续开源最新模型。传闻小模型团队已解散,Qwen 3.6/3.7可能是最后一代开源模型。