我在68,000件艺术品上部署了多模态语义搜索。Modal + L40S + Qwen3-VL-Embedding
摘要
一位开发者使用Qwen3-VL-Embedding、FAISS、Modal和Cloudflare R2,在国家美术馆的68,000件艺术品上构建了多模态语义搜索系统。该系统热响应时间约1.3秒,冷启动约44秒,同时支持文本到图像和图像到图像的查询。
相似文章
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval
This paper compares natively multimodal embedding models (Gemini Embedding 2, Amazon Nova 2) against frontier LLMs (GPT-4.1, Claude Sonnet 4.6) for hard-negative text-to-image retrieval, finding comparable accuracy but much lower latency for embedding-based ranking.
@modal: @Alibaba_Qwen 和 @alibaba_cloud 的 Qwen3.8-2.4T-A95B 现已登陆 Modal。配备自定义 DFlash 推测器…
阿里巴巴 Qwen 和阿里云的 Qwen3.8-2.4T-A95B 现已登陆 Modal,配备基于工具调用密集型数据训练的自定义 DFlash 推测器和完整的 1M 上下文窗口。
Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。
基于查询的跨模态投影器增强 Mamba 多模态大语言模型
本文提出了一种基于查询的跨模态投影器,通过交叉注意力机制对视觉标记进行压缩,以提升基于 Mamba 的多模态大语言模型的性能。该方法在视觉语言基准测试中同时提高了模型性能和吞吐量,并消除了手动设计二维扫描顺序的需求。
@modal:DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B。结合混合压缩注意力机…
DeepSeek-V4-Flash 是一个 284B 参数的 MoE 模型,每 token 激活 13B 参数,采用混合压缩注意力机制,可降低 1M token 上下文的 KV 缓存需求。可使用 Modal 上的 SGLang 提供服务,在单个 B300 上实现快速解码。