Hugging Face 上带视觉能力的 GLM 5.2

Reddit r/LocalLLaMA 模型

摘要

Baseten 在 Hugging Face 上发布了 GLM 5.2 Vision,将 Kimi k2.6 的视觉编码器集成到 GLM 5.2 模型中,解决了缺乏视觉能力的问题。

大家好,我还没看到有人在这里讨论这个模型,但看起来 Baseten(OpenRouter 上的推理提供商)将 Kimi k2.6 的视觉编码器合并到了 GLM 5.2 中。我觉得缺乏视觉能力是 GLM 5.2 刚推出时的一大槽点,我还没测试过这个模型,但 Baseten 能将其公开发布,确实挺棒的。https://huggingface.co/baseten/GLM-5.2-Vision-NVFP4
查看原文

相似文章

baseten/GLM-5.2-Vision-NVFP4

Hugging Face Models Trending

Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。