所有 Qwen 模型的单次生成:1109 个输出供你查看和比较!
摘要
一个周末项目在 OpenRouter 上生成了全部 33 个 Qwen 模型在 35 个提示下的单次生成输出并进行比较,共有 1109 个输出可在 oneshotlm.com 上查看。
这个周末我一直在忙着为 openrouter 上所有最便宜的模型生成单次输出,最终遍历了全部 33 个 Qwen 模型在 35 个提示下的测试(有一些失败,33*35 的矩阵中只有 1109 个成功生成)。这里是结果:https://oneshotlm.com/model/?q=qwen Qwen 3.7: qwen3.7-plus, qwen3.7-flash Qwen 3.6: qwen3.6-plus, qwen3.6-35b-a3b, qwen3.6-27b, qwen3.6-flash Qwen 3.5: qwen3.5-plus (02-15) · (20260420), qwen3.5-397b-a17b, qwen3.5-122b-a10b, qwen3.5-35b-a3b, qwen3.5-27b, qwen3.5-9b, qwen3.5-flash Qwen 3 (+2507 refresh): qwen3-235b-a22b (+2507, +thinking), qwen3-next-80b-a3b, qwen3-30b-a3b (+instruct-2507), qwen3-32b, qwen3-14b, qwen3-8b Qwen3-Coder: qwen3-coder, qwen3-coder-next, qwen3-coder-30b-a3b, qwen3-coder-flash Qwen3-VL: qwen3-vl-235b-a22b, qwen3-vl-32b, qwen3-vl-30b-a3b, qwen3-vl-8b Qwen 2.5: qwen2.5-72b, qwen2.5-7b
相似文章
@stevibe: 图像模型并排对比 随着 Qwen 今日发布 Qwen Image 3.0,我测试了4个提示词在4个图像模型上:> Q…
一位用户在推特帖子中比较了四个图像生成模型——Qwen Image 3.0、GPT Image 2、Nano Banana 2 和 Seedream 5.0 Pro——使用了四个提示词。
Qwen3.8 27B 单次提示 'Super Mario' 仿制品
Qwen3.8 27B 模型在单次提示中被用于生成一个 Super Mario Bros 克隆版,展示其编码和生成能力。
Qwen3.8 27B vs Qwen3.6 27B vs Qwen3.5 27B,代际间在单次提示能力上的轻微提升。
对Qwen 27B模型跨代比较显示单次提示能力有轻微提升,平均评分从2.46提高到3.00。
8 个无审查的 Qwen 3.8 27B 变体,1 个基座模型,167 GPU 小时 — Abliterlitics
本文对 8 个 Qwen 3.8 27B 模型的 abliterated 变体与基座模型进行了全面基准测试,消耗 167 GPU 小时,涵盖权重分析、KL 散度、13 项基准测试及 HarmBench 拒绝测试。分析表明,精细化编辑显著优于大幅修改:激进的 abliteration 会导致模型在多达 45% 的对抗性响应中陷入思考循环,且部分变体中检测到聊天模板操纵。
Qwen3.8-Flash-Next
Qwen 发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态 MoE 模型,拥有 125B tokens,但只有 6B 活跃参数,提供了性能提升,并作为 Qwen4 架构的早期预览。