所有 Qwen 模型的单次生成:1109 个输出供你查看和比较!

Reddit r/LocalLLaMA 工具

摘要

一个周末项目在 OpenRouter 上生成了全部 33 个 Qwen 模型在 35 个提示下的单次生成输出并进行比较,共有 1109 个输出可在 oneshotlm.com 上查看。

这个周末我一直在忙着为 openrouter 上所有最便宜的模型生成单次输出,最终遍历了全部 33 个 Qwen 模型在 35 个提示下的测试(有一些失败,33*35 的矩阵中只有 1109 个成功生成)。这里是结果:https://oneshotlm.com/model/?q=qwen Qwen 3.7: qwen3.7-plus, qwen3.7-flash Qwen 3.6: qwen3.6-plus, qwen3.6-35b-a3b, qwen3.6-27b, qwen3.6-flash Qwen 3.5: qwen3.5-plus (02-15) · (20260420), qwen3.5-397b-a17b, qwen3.5-122b-a10b, qwen3.5-35b-a3b, qwen3.5-27b, qwen3.5-9b, qwen3.5-flash Qwen 3 (+2507 refresh): qwen3-235b-a22b (+2507, +thinking), qwen3-next-80b-a3b, qwen3-30b-a3b (+instruct-2507), qwen3-32b, qwen3-14b, qwen3-8b Qwen3-Coder: qwen3-coder, qwen3-coder-next, qwen3-coder-30b-a3b, qwen3-coder-flash Qwen3-VL: qwen3-vl-235b-a22b, qwen3-vl-32b, qwen3-vl-30b-a3b, qwen3-vl-8b Qwen 2.5: qwen2.5-72b, qwen2.5-7b
查看原文

相似文章

8 个无审查的 Qwen 3.8 27B 变体,1 个基座模型,167 GPU 小时 — Abliterlitics

Reddit r/LocalLLaMA

本文对 8 个 Qwen 3.8 27B 模型的 abliterated 变体与基座模型进行了全面基准测试,消耗 167 GPU 小时,涵盖权重分析、KL 散度、13 项基准测试及 HarmBench 拒绝测试。分析表明,精细化编辑显著优于大幅修改:激进的 abliteration 会导致模型在多达 45% 的对抗性响应中陷入思考循环,且部分变体中检测到聊天模板操纵。

Qwen3.8-Flash-Next

Simon Willison's Blog

Qwen 发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态 MoE 模型,拥有 125B tokens,但只有 6B 活跃参数,提供了性能提升,并作为 Qwen4 架构的早期预览。