text-to-image-retrieval

标签

Cards List
#text-to-image-retrieval

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

arXiv cs.AI · 昨天 缓存

This paper compares natively multimodal embedding models (Gemini Embedding 2, Amazon Nova 2) against frontier LLMs (GPT-4.1, Claude Sonnet 4.6) for hard-negative text-to-image retrieval, finding comparable accuracy but much lower latency for embedding-based ranking.

0 人收藏 0 人点赞
← 返回首页

提交意见反馈