mindlab-research/Macaron-V1-Venti • HuggingFace

Reddit r/LocalLLaMA 模型

摘要

MindLab Research 发布了 Macaron-V1-Venti,这是一个新的多模态 AI 模型,在 HuggingFace 上可用,可能用于文本到图像或图像生成任务。

https://preview.redd.it/67lb9m0pfleh1.jpg?width=2048&format=pjpg&auto=webp&s=9cebf34a2b3b98815fe3aa525ebe412eedcf225f https://huggingface.co/mindlab-research/Macaron-V1-Venti https://macaron.im/zh/mindlab/research/introducing-macaron-v1
查看原文

相似文章

Macaron-V1系列,基于Qwen3.6-35B-A3B构建

Reddit r/LocalLLaMA

MindLab Research发布了Macaron-V1-Tall,这是一个基于Qwen3.6-35B-A3B构建的Mixture of LoRA模型,配备了四个分别用于对话、代理、编码和GenUI任务的专家模块,上下文长度为262K。

apple/LensVLM-9B · Hugging Face

Reddit r/LocalLLaMA

LensVLM-9B是苹果公司开发的一个拥有90亿参数的视觉语言模型,它能扫描压缩的文本图像,并利用学习到的工具选择性地展开相关页面,同时提供了论文、代码和使用说明。

LiquidAI/LFM2.5-VL-3B · Hugging Face

Reddit r/LocalLLaMA

LiquidAI releases LFM2.5-VL-3B, a 3B multimodal model for on-device deployment with improved OCR, grounding, and efficient inference, available in multiple formats including GGUF, ONNX, and MLX.