Flux 3 Action: 开放权重 7B 世界动作模型

Reddit r/singularity 模型

摘要

FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。

一款开放权重的 7B 世界动作模型,在 RoboLab 基准测试中取得了第一名。它比之前最佳开源模型高出 6.1 个百分点,同时使用了 56% 更少的参数,并且运行速度最高快 3.95 倍。⁠⁠ FLUX 3 Action 消除了世界动作模型性能与 VLA 速度之间的常见权衡:它仍然同时预测视频和动作,但规划距离超过两倍,并且比最强的开源 VLA 每秒机器人运动运行更快。团队可以基于自己的演示数据对 FLUX 3 Action 进行微调,以为特定机器人和任务创建策略。除了机器人技术,我们还看到在训练特定任务策略方面取得了有希望的结果,这些策略适用于模拟环境中的行动,如游戏、控制车辆、计算机使用,以及其他任何需要模型理解视觉环境并决定下一步操作的场景。FLUX 3 Action 基于与 FLUX 3 相同的图像、视频和音频预训练构建,但采用了为实际部署设计的更小架构。在中期训练中,我们训练模型同时预测动作和未来帧。https://bfl.ai/models/flux-3-action https://huggingface.co/collections/black-forest-labs/flux-3-action
查看原文

相似文章

Flux 3 X Mimic:新一代视频-动作模型

Hacker News Top

Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。

FLUX 3

Replicate Explore

FLUX 3 是来自 Black Forest Labs 的多模态AI模型,能够根据文本提示生成同步的视频和音频,并可选择性地输入图像或视频。