忘掉鹈鹕,迎来象鼻虫时代! / 防基准测试过度的 SVG 和视觉基准测试

Reddit r/LocalLLaMA 新闻

摘要

本文介绍了使用不同量化和设置测试 Qwen3.8-27B AI 模型,以将其图像重建为 SVG,目标是创建一个能抵御基准测试过度优化的基准。初步结果显示,高推理强度和特定的缓存配置能提升性能。

艺术家:Qwen3.8-27B-UD-Q3\K_XL, q8_0 缓存, xhigh, 温度 1.0, image-min-tokens 1024, froggeric 模板) 我尝试了不同的 Qwen3.8-27B 量化版本,想到了这个非常简单但似乎能抵御基准测试过度的组合 SVG 和视觉测试。只需让模型使用此提示将任何给定图像重建为 SVG:重建为 SVG。鹈鹕很容易被基准测试过度优化,而重建随机照片似乎更难训练。我尝试了许多非常复杂的提示,但在我看来,上述提示效果最好。我还尝试了不同的 --image-min-tokens 从 512 到 4096,不同的推理级别从无推理到 xhigh,不同的温度和不同的 kv 缓存。初步结果是,--image-min-tokens 1024 和 --reasoning-effort xhigh,以及 --temperature 1.0 和 --cache-type-k bf16 和 --cache-type-v bf16 给出最佳结果。非推理结果,至少在我能运行的量化版本(Q3 和 Q4)中,相当令人不安……我还怀疑聊天模板会影响输出质量——如果你无聊的话请检查一下。有趣的是,kv 缓存在 q8_0 时也给出了“好”结果,但 q4_0 完全破坏了输出质量(到处都是昆虫腿……哦,我看到的恐怖景象),这是一个视觉上令人印象深刻的提醒,永远不要使用 q4_0 缓存!我想看看 Q6 到 BF16 模型量化在这个任务上的表现。如果你有足够的显存,你知道该怎么做! ;) 使用的量化版本: - Qwen3.8-27B-UD-Q3_K_XL (V2) - Qwen3.8-27B-UD-Q4_K_XL (V2) 使用的模板: - 内置 - qwen3.8-froggeric-v22.3.1 我尝试的其他提示: - 详细分析并非常细致地描述透视、构图、比例、颜色等。重建为简化但忠实于原始 SVG - 分析透视、构图、颜色和细节。复制为简化但忠实于原始 SVG - 重建为 SVG。简化但使其可识别 - 制作 SVG 副本 - 复制为 SVG - 重建为简化但忠实于原始 SVG
查看原文

相似文章

新基准测试发布!

Reddit r/LocalLLaMA

新基准测试对比了Qwen3.8-27b、Sol 5.6和Qwen3.6-35B模型在生成沙漠中骆驼背景下的自行车上的马SVG图像时的性能,使用了包含拼写错误的提示。