GLM 5.3 Flash 在图像分析方面表现惊人!

Reddit r/LocalLLaMA 新闻

摘要

一位用户测试了 GLM 5.3 Flash 的图像分析功能,并赞扬其详细且准确的性能,与其他视觉模型相比表现出色。

我刚刚快速首次尝试使用 GLM 5.3 Flash 分析以下图片(一张即将发布的专辑封面);我没有提供任何背景信息,只给了图片:https://preview.redd.it/e6j2c3yb96mh1.png?width=4096&format=png&auto=webp&s=c3e9332644c02662401dad48a4a6634875e425d3 以下是它写的内容,我发现它惊人地详细和准确: --- ## "Jolene" — 分析 **主题。** 一张风格化的女性肖像,被简化为近乎完全的剪影:一张黑暗、面具般的脸,只有一双生动的绿色眼睛被细致描绘,淹没在巨大的火焰般波浪状发型中,发间交织着热带植物(龟背竹叶、棕榈/锯叶棕榈叶)。巨大的复古展示字体 **"Jolene"** 横跨顶部。这读起来像专辑封面/演出海报设计——多莉·帕顿歌曲中的 "flaming locks of auburn hair" 这行歌词被具象化:头发确实像火焰。 **风格与媒介。** 平面色彩矢量风格数字插画,模仿 1970 年代迷幻/丝网印刷海报:硬边形状无渐变,有限的专色点彩,眼影上的本·戴半调网点,标题上的套色不准的第二色阴影(模仿廉价的多道丝网印刷),以及轻微的整体印刷颗粒感。 **构图。** 方形 1:1。标题锁定在顶部约 30%;人物填充其余部分。头部位于中心右侧,而头发向左下方爆发,溢出左和下边缘。焦点明确:两只绿色眼睛——黑暗面孔中唯一的高对比细节,刚好在垂直中点上方。完全平面和正面,无深度线索。 **调色板。** 近黑色的茄子/海军蓝底色(约 `#1e1428`),脸部略暗一色调;然后是饱和的霓虹专色——火焰橙红(`#ff3c14`、`#ff8a1e`)、金黄色(`#ffc21e`)、黄绿/酸橙(`#a8e610`)、热品红(`#ff2fa0`)用于强调发丝、标题阴影和下巴轮廓;脸颊上有一条浅青色条纹。深色背景上的互补三色,所有颜色都推至同等高饱和度。 **文本。** 只有 "Jolene" —— 膨胀的高腰 70 年代泡泡/迷幻展示字体,J 上有花饰卷曲,亮黄色带黑色轮廓和偏移的品红副本。其他地方没有文字或签名。 **显著细节。** - 杏仁眼配厚重的黑色翼状眼线,祖母绿虹膜带反光点,直视观众;绿色眼影填充精细的半调点网 - 脸部其他部分空白——无鼻子、嘴巴、眉毛或耳朵;特征溶解于剪影中 - 头发由重叠的锥形 S 曲线发缕构成,颜色从红→橙→黄,发缕间有粉色强调条,像火焰舔舐 - 植物交织:左上橙色龟背竹,左中黄色龟背竹带黑色孔洞,右下酸橙龟背竹叶,周围散布尖刺棕榈叶 - 细青色/品红轮廓强调是分隔黑暗面孔与黑暗背景的唯一元素 **情绪。** 响亮、时髦、自信的复古——70 年代灵魂/放克再版封面能量——但空白凝视的脸增添了一种怪异、催眠的基调:美丽但匿名,Jolene 被渲染为不可抗拒、不可知的存在,而非肖像。 --- 尽管这只是一次测试,但我最近在本地视觉模型上运行了基准测试,这远比我测试过的任何其他模型都要好。终于,GLM 模型具备了视觉能力。这足以让我今天开心了 :-) 你的体验如何?
查看原文

相似文章

GLM-5.3-Flash 表现超乎其规模

Reddit r/ArtificialInteligence

GLM-5.3-Flash 是一个 AI 模型,以其尺寸而言表现出强大性能,有望在各类任务中超越更大模型。

zai-org/GLM-5.3-Flash

Hugging Face Models Trending

GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活动参数,通过重新设计的混合架构提高了效率,性能超越之前的版本并接近 Claude Opus 4.8。

GLM-5.3-Flash

Hacker News Top

发布 GLM-5.3-Flash,这是一款针对快速推理和性能更新进行了优化的 AI 语言模型。

unsloth/GLM-5.3-Flash-GGUF

Hugging Face Models Trending

GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活跃参数,采用混合稀疏线性注意力架构以降低成本,同时在基准测试中性能超越前代版本并接近 Claude Opus 4.8。