标签
本文介绍了SAPO,一种分段级自动提示优化方法,它将提示分解为角色、上下文、任务和输出格式,然后基于弱示例和强示例进行针对性改进。在多个基准测试上的评估表明,SAPO在GPT-3.5-Turbo和GPT-4o-mini上优于包括APE、OPRO、EvoPrompt、GEPA和StraGO在内的强APO基线。
本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。
iFAN是一个训练框架,通过将查询排序与掩码质量对齐,并将中间层的预测蒸馏到最终层,来改进用于分割的掩码Transformer,从而在多个基准上取得一致的性能提升。
本文介绍了结构化全掩码预测(Structured All-Mask Prediction)及STAMPlus方法,这是一种基于MLLM的分割方法,通过一次非自回归过程联合预测所有目标掩码,解决了高分割性能、保持对话能力与快速推理之间的三难问题。
GLI-AL是一种新的胶质瘤MRI标签资源,统一了解剖和病灶标签,将监督范围扩展至健康组织和先前未标记的异常区域。该资源提供了与BraTS-GLI病例对齐的1,251组标签集。
本文对ESA的φ-lab开发的两个地理空间基础模型TerraMind和THOR进行了系统比较,分析了补丁大小和解码器类型等架构选择如何影响地球观测任务中十个用例的性能。
该推文称赞SAM3.1改进了分割效果,能处理模糊边界,并且尾部覆盖更好,从而得到更准确的长度测量。
本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。
REBASE 是一个无需训练框架,通过将特征投影到低秩背景子空间的正交补上,抑制情境分割中的伪上下文对应,在多个数据集上达到了无需训练方法中的最佳性能。
本文介绍了SAM-MT,它是SAM2的一个扩展,用于实时交互式多目标视频分割,实现了与目标数量无关的高帧率(FPS)。
本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。
本文介绍了CALHippo,一个利用最先进的分割和密度估计模型对人脑海马体中的神经元和胶质细胞进行3D映射的框架。
本文提出MAOAM,一个统一的视觉-语言模型框架,能够通过文本或点击交互实现精确的物体和材质选择,用于交互式图像编辑。它引入了一个可扩展的数据生成流程,并展示了在推理时结合文本和点击的涌现提升。
组提示(Group Prompting)引入了一种无训练框架,用于细胞实例分割,只需对每种细胞类型进行一次点击,利用Segment Anything Model的特征空间递归扩展提示,无需训练即可实现有竞争力的性能。
InstructSAM 提出了一个统一的框架,用于多实例分割,采用指令驱动的查询,桥接视觉语言模型和 SAM3,在复杂基准上取得了强劲结果。
介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。
AuralSAM2通过AuralFuser模块将音频集成到SAM2中,该模块从视听特征生成稀疏和密集提示,在保持交互效率的同时增强跨模态分割。
介绍了CAFE,一种通过反事实属性操作来评估可提示分割模型是否真正理解概念的基准,揭示了精确的掩码预测并不能保证忠实的语义基础。
# 论文页面 - TwinTrack:医学影像分割的事后多标注者校准 来源:[https://huggingface.co/papers/2604.15950](https://huggingface.co/papers/2604.15950) ## 摘要 TwinTrack 框架通过将集成概率事后校准为经验平均人类响应,解决胰腺癌分割中的模糊性,在多标注者基准上提升校准指标。