vision-language-retrieval

标签

Cards List
#vision-language-retrieval

所有视觉标记都同等重要吗?面向视觉-语言检索的保留对象证据的标记合并

Hugging Face Daily Papers · 2026-07-06 缓存

介绍了SaMer,一种面向对象的标记合并框架,用于压缩视觉-语言检索中的图像侧标记,同时保留对象级证据,显著减少存储并提升检索性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈