标签
Anthropic 和 OpenAI 在 2026 年通过商业模式细分而非技术创新赢得市场份额:Anthropic 的企业计量计费让其营收在一个季度内翻倍,而 OpenAI 对最便宜的 Luna 模型降价 80%,使其营收年化运行率逼近 700 亿美元。两家公司年底营收均有望接近 1000 亿美元,但利润率和客户锁定仍存在不确定性。
一位博士生分享了关于生物成像分析AI程序的论文发布,该程序使用SAM和SAM2模型自动化科学应用中的分割和数据提取。
本文介绍了Segment-Snap,一种结合几何与语义线索的方法,以提升三维场景中的交互理解,在运动门控AP和手柄检测指标上取得了显著提升。
本文评估了 nnU-Net 在 BraTS-GoAT 2026 挑战中脑肿瘤分割的泛化能力,报告了性能指标并分析了失败案例。
一个实验,其中两个分割模型使用GPT-6 Astra Ultra作为编排器进行训练,未使用人工标签,由于时间限制提示较为随意,并展示了在保留视频上的预测结果。
本文介绍了SAPO,一种分段级自动提示优化方法,它将提示分解为角色、上下文、任务和输出格式,然后基于弱示例和强示例进行针对性改进。在多个基准测试上的评估表明,SAPO在GPT-3.5-Turbo和GPT-4o-mini上优于包括APE、OPRO、EvoPrompt、GEPA和StraGO在内的强APO基线。
本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。
iFAN是一个训练框架,通过将查询排序与掩码质量对齐,并将中间层的预测蒸馏到最终层,来改进用于分割的掩码Transformer,从而在多个基准上取得一致的性能提升。
本文介绍了结构化全掩码预测(Structured All-Mask Prediction)及STAMPlus方法,这是一种基于MLLM的分割方法,通过一次非自回归过程联合预测所有目标掩码,解决了高分割性能、保持对话能力与快速推理之间的三难问题。
GLI-AL是一种新的胶质瘤MRI标签资源,统一了解剖和病灶标签,将监督范围扩展至健康组织和先前未标记的异常区域。该资源提供了与BraTS-GLI病例对齐的1,251组标签集。
本文对ESA的φ-lab开发的两个地理空间基础模型TerraMind和THOR进行了系统比较,分析了补丁大小和解码器类型等架构选择如何影响地球观测任务中十个用例的性能。
该推文称赞SAM3.1改进了分割效果,能处理模糊边界,并且尾部覆盖更好,从而得到更准确的长度测量。
本文介绍了VIP-SAM用于实例级服装分割,以及CtrlVTON,一个将试穿视为图像编辑问题的可控虚拟试穿框架,允许精确控制服装的布局、样式和位置。两种方法在各自任务上均达到最先进水平。
REBASE 是一个无需训练框架,通过将特征投影到低秩背景子空间的正交补上,抑制情境分割中的伪上下文对应,在多个数据集上达到了无需训练方法中的最佳性能。
本文介绍了SAM-MT,它是SAM2的一个扩展,用于实时交互式多目标视频分割,实现了与目标数量无关的高帧率(FPS)。
本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。
本文介绍了CALHippo,一个利用最先进的分割和密度估计模型对人脑海马体中的神经元和胶质细胞进行3D映射的框架。
本文提出MAOAM,一个统一的视觉-语言模型框架,能够通过文本或点击交互实现精确的物体和材质选择,用于交互式图像编辑。它引入了一个可扩展的数据生成流程,并展示了在推理时结合文本和点击的涌现提升。