Hugging Face 上带视觉能力的 GLM 5.2
摘要
Baseten 在 Hugging Face 上发布了 GLM 5.2 Vision,将 Kimi k2.6 的视觉编码器集成到 GLM 5.2 模型中,解决了缺乏视觉能力的问题。
大家好,我还没看到有人在这里讨论这个模型,但看起来 Baseten(OpenRouter 上的推理提供商)将 Kimi k2.6 的视觉编码器合并到了 GLM 5.2 中。我觉得缺乏视觉能力是 GLM 5.2 刚推出时的一大槽点,我还没测试过这个模型,但 Baseten 能将其公开发布,确实挺棒的。https://huggingface.co/baseten/GLM-5.2-Vision-NVFP4
相似文章
baseten/GLM-5.2-Vision-NVFP4
Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。
GLM-5.2 现已可在 HuggingChat 上使用
GLM-5.2 是 zai-org 的一个开源 AI 模型,现已在 HuggingChat 上可用。
我构建了一个微型代理,为GLM 5.2(或任何文本LLM)赋予视觉能力 – MIT
VisionBridge是一个开源代理,通过让推理模型查询独立的视觉模型进行图像检查、OCR等操作,为纯文本LLM赋予视觉能力。
@mr_r0b0t:官方 @NVIDIAAI GLM5.1-NVFP4 在 @huggingface 上被发现
NVIDIA 发布了 GLM-5.1-NVFP4,这是 ZAI 的 GLM-5.1 模型的量化版本,总参数 754B(激活参数 40B),在 Hugging Face 上以 MIT 许可证提供。
GLM-5.2 为开放模型树立更高标杆(14分钟阅读)
GLM-5.2 是一款新的开源AI模型,为开放模型树立了高标准,但仍在追赶专有前沿模型,并且缺乏一些功能,如视觉功能。