忘掉鹈鹕,迎来象鼻虫时代! / 防基准测试过度的 SVG 和视觉基准测试
摘要
本文介绍了使用不同量化和设置测试 Qwen3.8-27B AI 模型,以将其图像重建为 SVG,目标是创建一个能抵御基准测试过度优化的基准。初步结果显示,高推理强度和特定的缓存配置能提升性能。
艺术家:Qwen3.8-27B-UD-Q3\K_XL, q8_0 缓存, xhigh, 温度 1.0, image-min-tokens 1024, froggeric 模板)
我尝试了不同的 Qwen3.8-27B 量化版本,想到了这个非常简单但似乎能抵御基准测试过度的组合 SVG 和视觉测试。只需让模型使用此提示将任何给定图像重建为 SVG:重建为 SVG。鹈鹕很容易被基准测试过度优化,而重建随机照片似乎更难训练。我尝试了许多非常复杂的提示,但在我看来,上述提示效果最好。我还尝试了不同的 --image-min-tokens 从 512 到 4096,不同的推理级别从无推理到 xhigh,不同的温度和不同的 kv 缓存。初步结果是,--image-min-tokens 1024 和 --reasoning-effort xhigh,以及 --temperature 1.0 和 --cache-type-k bf16 和 --cache-type-v bf16 给出最佳结果。非推理结果,至少在我能运行的量化版本(Q3 和 Q4)中,相当令人不安……我还怀疑聊天模板会影响输出质量——如果你无聊的话请检查一下。有趣的是,kv 缓存在 q8_0 时也给出了“好”结果,但 q4_0 完全破坏了输出质量(到处都是昆虫腿……哦,我看到的恐怖景象),这是一个视觉上令人印象深刻的提醒,永远不要使用 q4_0 缓存!我想看看 Q6 到 BF16 模型量化在这个任务上的表现。如果你有足够的显存,你知道该怎么做! ;)
使用的量化版本:
- Qwen3.8-27B-UD-Q3_K_XL (V2)
- Qwen3.8-27B-UD-Q4_K_XL (V2)
使用的模板:
- 内置
- qwen3.8-froggeric-v22.3.1
我尝试的其他提示:
- 详细分析并非常细致地描述透视、构图、比例、颜色等。重建为简化但忠实于原始 SVG
- 分析透视、构图、颜色和细节。复制为简化但忠实于原始 SVG
- 重建为 SVG。简化但使其可识别
- 制作 SVG 副本
- 复制为 SVG
- 重建为简化但忠实于原始 SVG
相似文章
哪些当前能在128GB内运行的本地模型生成最佳SVG鹈鹕?
文章对在128GB Apple Silicon上运行的本地LLM进行基准测试,用于生成SVG鹈鹕,比较了Qwen3.8变体和DeepSeek V4的量化版本,量化由Unsloth完成。
Qwen 3.6 27B 的量化是否会破坏 pelican?
本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。
模型与量化质量测试结果 - 棋盘 SVG (Qwen3.6 27B/35B-A3B/Zaya1)
社区测试者使用MLX等本地推理框架,评估Qwen3.6、ZAYA1等模型的量化版本在SVG棋盘生成准确性方面的表现。
我的笔记本上的Qwen3.6-35B-A3B画出的鹈鹕比Claude Opus 4.7更好
Simon Willison对比了在MacBook Pro上本地运行的Qwen3.6-35B-A3B与Claude Opus 4.7,发现Qwen生成的骑自行车的鹈鹕和骑独轮车的火烈鸟的SVG插图更好,不过他指出这个狭窄的基准测试并不能反映更广泛的模型能力。
新基准测试发布!
新基准测试对比了Qwen3.8-27b、Sol 5.6和Qwen3.6-35B模型在生成沙漠中骆驼背景下的自行车上的马SVG图像时的性能,使用了包含拼写错误的提示。