@HaiyuWu1: 首先在潜空间中从互联网视频学习因果关系,然后使用强化学习教基础模型如何行动…

X AI KOLs Following 模型

摘要

Induction Labs 推出了想象模型(imagination models),这是一种新的基础模型架构,从互联网规模的视频中学习。他们的第一个模型 Photon-1 通过观看 18 年的屏幕录像(无动作标签)学习使用计算机,以比 Gemini 3.1 Flash 低 30 倍的预训练成本取得了更好的结果。

首先在潜空间中从互联网视频学习因果关系,然后使用强化学习教基础模型如何行动。 这种方法在预训练上比 Gemini 3.1 Flash 便宜 30 倍,并且取得了更好的结果。JEPA 就够了! 然而,动作仍然在训练后学习。弄清楚如何在没有动作标签的情况下自动学习动作仍然非常重要!
查看原文
查看缓存全文

缓存时间: 2026/07/25 20:11

先在潜在空间中从互联网视频学习因果关系,再用强化学习教会基础模型如何行动。

这种方法在预训练上比 Gemini 3.1 Flash 便宜 30 倍,且结果更优。JEPA 就够了!

不过,动作仍是在后训练阶段学习的。如何在没有动作标签的情况下自动学习动作,依然至关重要!

Induction Labs(@induction_labs): 我们正推出想象模型:一种全新的基础模型架构,能够从互联网规模视频中解锁学习能力。

我们的首个想象模型 Photon-1,通过观看 18 年屏幕录制视频(无动作标签)学会了使用电脑。

相似文章

@swyx: 完整文章和链接在此

X AI KOLs Timeline

Latent Space 播客的一集讨论了这样一个论点:视频模型从大语言模型(LLM)中获取智能,下一个前沿是视频智能体。嘉宾 Ethan He(曾在 xAI 构建 Grok Imagine)分享了构建前沿图像和视频系统的见解。

通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。