标签
本文提出了 PANORAMA,一个用于全景定位描述的视觉-语言模型,该模型通过掩码提案选择利用像素级掩码为描述进行定位,并引入了 PanoCaps 基准进行评估。
MultiMatte 是一个可提示的图像背景移除模型,基于 SAM 3 使用 LoRA 进行微调,通过输出 alpha 遮罩来更好地处理模糊边界,在基准测试中实现了更高的准确性。
分享了一种技术,使用Segment Anything Model (SAM)无需提示即可分割图像,通过利用显微镜图像之间的相似性,实现类似于视频的零样掩码传播。
一位用户分享了关于SAM 3.1的热情反馈:仅用'worm'等简单文本提示即可精准分割图像,相比SAM 1有显著提升。
SAM 3 引入了一个统一的模型,用于基于提示的概念分割与跟踪,通过解耦的识别与定位架构以及可扩展的数据引擎,实现了最先进的性能。
BiRefNet 是一个在 Replicate 上提供的图像分割 AI 模型,可在 Nvidia A100 GPU 上提供经济高效的推理,并且是开源的。