@rohanpaul_ai:AI 不应只是变大,还应更精确、更易管理。我在 360 AI Research Institute 看到的……
摘要
360 AI Research Institute 的 MoSA(Motion-Grounded Segment Anything),已被 ECCV 2026 接收,它训练 Segment Anything 模型利用未标注视频中的运动线索来分割物体,无需人工注释即可生成数百万个伪标签。
查看缓存全文
缓存时间: 2026/07/14 16:28
AI 不应只是变得更大,还应更精准、更易于管理。
我在 360 人工智能研究院 2026 年上半年发表的论文中看到的是:精准识别、精准编辑、精准生成。
被 ECCV 2026 接收的 MoSA(基于运动的分割一切模型)属于“精准识别”方向。
其前提很简单但至关重要:视频能否教会 AI 理解事物,而无需人工逐一标注?
MoSA 从约 10,000 小时的无标签视频中生成了超过 2,100 万个伪标签。
Segment Anything Model 是基于注释训练的。而 MoSA 则验证了“事物可以从自身运动学习”这一想法。
这之所以重要,是因为普通视频可以用来大规模训练能够识别事物的 AI。
因此,MoSA 不仅仅是一篇关于分割的论文。它是一项更大研究目标的一部分:使 AI 的感知、编辑和生成在现实世界中更准确、更可控、更实用。
Shruti (@heyshrutimishra): 突发:中国网络安全公司刚刚找到了解决 AI 最昂贵问题之一的方法。
Meta 构建了一个名为 SAM 的 AI 模型,可以勾勒出照片中任何物体的轮廓。但问题在于:它需要数百万张手工标注的图像来学习如何做到这一点。
360 AI 研究院的新 ECCV 2026
相似文章
@heyshrutimishra: 重磅:中国网络安全公司刚刚找到了一种绕过人工智能最昂贵问题之一的方法。Meta 构建了一个 AI m…
360 AI Research 提出了 MoSA,一种从 10,000 小时未标注视频中学习物体识别的方法,可生成超过 2100 万个自动标签,无需人工干预,解决了 AI 昂贵标注的瓶颈。
SAM 3.1:通过多路复用和全局推理实现更快、更易用的实时视频检测与跟踪
Meta AI 发布了 SAM 3.1,这是 Segment Anything Model(分割一切模型)的一次更新,通过引入多路复用和全局推理能力,增强了实时视频检测与跟踪性能。
idea-research/ram-grounded-sam
Recognize Anything Model (RAM) 是一个强大的图像标注模型,具备零样本泛化能力,现已与 Grounded-Segment-Anything 结合,用于开放集目标检测和分割,性能显著超越 CLIP 和 BLIP。
@rohanpaul_ai: Thinking Machines 正在用始终在线的 AI 取代轮次交互式的 AI。他们刚刚发布了 TML-Interaction-Small,一个 276B 参数的 MoE 模型……
Thinking Machines 发布了 TML-Interaction-Small,这是一个 276B 参数的 MoE 模型,专为实时、始终在线的交互设计,延迟低于 0.4 秒,并集成了多模态处理能力。
robbyant/lingbot-video-moe-30b-a3b
LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。