Flux 3 Action: 开放权重 7B 世界动作模型
摘要
FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。
一款开放权重的 7B 世界动作模型,在 RoboLab 基准测试中取得了第一名。它比之前最佳开源模型高出 6.1 个百分点,同时使用了 56% 更少的参数,并且运行速度最高快 3.95 倍。 FLUX 3 Action 消除了世界动作模型性能与 VLA 速度之间的常见权衡:它仍然同时预测视频和动作,但规划距离超过两倍,并且比最强的开源 VLA 每秒机器人运动运行更快。团队可以基于自己的演示数据对 FLUX 3 Action 进行微调,以为特定机器人和任务创建策略。除了机器人技术,我们还看到在训练特定任务策略方面取得了有希望的结果,这些策略适用于模拟环境中的行动,如游戏、控制车辆、计算机使用,以及其他任何需要模型理解视觉环境并决定下一步操作的场景。FLUX 3 Action 基于与 FLUX 3 相同的图像、视频和音频预训练构建,但采用了为实际部署设计的更小架构。在中期训练中,我们训练模型同时预测动作和未来帧。https://bfl.ai/models/flux-3-action https://huggingface.co/collections/black-forest-labs/flux-3-action
相似文章
BFL发布FLUX 3 Action:一款70亿参数机器人模型
Black Forest Labs发布了FLUX 3 Action,这是一组面向机器人的70亿参数AI模型,包含基础模型以及适用于SO-101和DROID的控制策略,已在Hugging Face平台上线。
Flux 3 X Mimic:新一代视频-动作模型
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。
Black Forest Lab's Flux 3: 全模态用于图像、视频、音频和动作预测
Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。
FLUX 3
FLUX 3 是来自 Black Forest Labs 的多模态AI模型,能够根据文本提示生成同步的视频和音频,并可选择性地输入图像或视频。
FLUX 3 - 现实世界模型:迈向多模态流模型作为视觉智能的骨干
FLUX 3 提出了多模态流模型作为现实世界视觉智能的基础方法,建立在之前的 FLUX 工作之上。