@rohanpaul_ai:AI 不应只是变大,还应更精确、更易管理。我在 360 AI Research Institute 看到的……

X AI KOLs Timeline 论文

摘要

360 AI Research Institute 的 MoSA(Motion-Grounded Segment Anything),已被 ECCV 2026 接收,它训练 Segment Anything 模型利用未标注视频中的运动线索来分割物体,无需人工注释即可生成数百万个伪标签。

AI 不应只是变大,还应更精确、更易于管理。 我在 360 AI Research Institute 的 2026 年上半年论文中看到的是:精确看、精确编辑、精确生成。 MoSA(Motion-Grounded Segment Anything)已被 ECCV 2026 接收,属于“精确看”方向。 前提简单却至关重要:视频能否教会 AI 理解事物,而无需人为逐一标注? MoSA 从约 10,000 小时的未标注视频中生成了超过 2100 万个伪标签。 Segment Anything 模型基于标注训练。MoSA 验证了物体是否可以从运动中学习这一概念。 这意义重大,因为普通视频可用于大规模训练能够识别物体的 AI。 这正是 MoSA 不仅仅是一篇关于分割的论文的原因。它是更大研究目标的一部分,即让 AI 的感知、编辑和生成在现实世界中更准确、可控且实用。
查看原文
查看缓存全文

缓存时间: 2026/07/14 16:28

AI 不应只是变得更大,还应更精准、更易于管理。

我在 360 人工智能研究院 2026 年上半年发表的论文中看到的是:精准识别、精准编辑、精准生成。

被 ECCV 2026 接收的 MoSA(基于运动的分割一切模型)属于“精准识别”方向。

其前提很简单但至关重要:视频能否教会 AI 理解事物,而无需人工逐一标注?

MoSA 从约 10,000 小时的无标签视频中生成了超过 2,100 万个伪标签。

Segment Anything Model 是基于注释训练的。而 MoSA 则验证了“事物可以从自身运动学习”这一想法。

这之所以重要,是因为普通视频可以用来大规模训练能够识别事物的 AI。

因此,MoSA 不仅仅是一篇关于分割的论文。它是一项更大研究目标的一部分:使 AI 的感知、编辑和生成在现实世界中更准确、更可控、更实用。

Shruti (@heyshrutimishra): 突发:中国网络安全公司刚刚找到了解决 AI 最昂贵问题之一的方法。

Meta 构建了一个名为 SAM 的 AI 模型,可以勾勒出照片中任何物体的轮廓。但问题在于:它需要数百万张手工标注的图像来学习如何做到这一点。

360 AI 研究院的新 ECCV 2026

相似文章

idea-research/ram-grounded-sam

Replicate Explore

Recognize Anything Model (RAM) 是一个强大的图像标注模型,具备零样本泛化能力,现已与 Grounded-Segment-Anything 结合,用于开放集目标检测和分割,性能显著超越 CLIP 和 BLIP。

robbyant/lingbot-video-moe-30b-a3b

Hugging Face Models Trending

LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。