vla

标签

Cards List
#vla

未见先觉:世界行动模型的潜在未来

arXiv cs.AI · 4天前 缓存

提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。

0 人收藏 0 人点赞
#vla

@AdinaYakup: Xiaomi Robotics-1,来自@XiaomiTech_ 的新机器人基础模型 - 10万+小时真实世界机器人数据 - VLA架构…

X AI KOLs Following · 2026-08-05 缓存

小米宣布推出Robotics-1,这是一种采用VLA架构的新型机器人基础模型,基于超过10万小时的真实世界机器人数据进行训练,具备跨本体泛化和快速适应新任务的能力。

0 人收藏 0 人点赞
#vla

从世界到手腕:面向精细机器人操作的任务条件未来手腕建模

Hugging Face Daily Papers · 2026-08-05 缓存

介绍了W2-VLA,一种用于精细机器人操作的视觉-语言-动作模型,该模型对任务条件下的未来手腕观测进行建模,在基准测试和真实世界任务中实现了改进的操作性能。

0 人收藏 0 人点赞
#vla

@songhan_mit:探索 VLASH:通过未来状态感知异步推理实现的实时 VLA

X AI KOLs Following · 2026-07-28 缓存

MIT 研究人员开发了 VLASH,这是一种使视觉-语言-动作模型能够预测未来机器人状态的方法,在拾取放置和乒乓球等任务中速度加倍并减少延迟。

0 人收藏 0 人点赞
#vla

基于表示锚定与语言-动作对齐的泛化VLA微调

Hugging Face Daily Papers · 2026-07-15 缓存

Anchor-Align通过视觉-语言锚定增强行为克隆,以保留预训练表示和语言-动作对齐,在xArm7上使真实机器人成功率提升超过20%,并在模拟基准测试中持续取得改进。

0 人收藏 0 人点赞
#vla

CLAP:通过语言-动作对齐实现从VLM到VLA的直接适配

arXiv cs.AI · 2026-07-13 缓存

CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。

0 人收藏 0 人点赞
#vla

像机器人一样看:面向视觉-语言-动作模型的机器人中心点云图

Hugging Face Daily Papers · 2026-07-13 缓存

本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。

0 人收藏 0 人点赞
#vla

@robbyant_brain: LingBot-VLA 2.0 现已开源——我们新一代的具身基础模型。6万小时高质量预训练数据…

X AI KOLs Timeline · 2026-07-07 缓存

LingBot-VLA 2.0,一个开源的具身基础模型,已发布,拥有6万小时预训练数据,支持17个品牌的20种机器人配置,在RTX 4090上推理时间低于130毫秒。

0 人收藏 0 人点赞
#vla

@svlevine:要想让机器人做好一件事,你需要知道如何与它对话。如果你不会,你可以学习,通过Semanti…

X AI KOLs Following · 2026-07-03 缓存

本文介绍了语义动作强化学习(Semantic Action RL),它通过对视觉-语言-动作(VLA)提示进行强化学习,使机器人能够在现实世界中快速学习新任务。

0 人收藏 0 人点赞
#vla

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

arXiv cs.AI · 2026-06-24 缓存

介绍了Neuro-Symbolic Drive,一个使用来自经典规划器的基于规则推理轨迹来微调驾驶VLA(Qwen3.5-4B)的框架,与标准CoT推理相比,显著降低了平均位移误差和漏检率。

0 人收藏 0 人点赞
#vla

PersonaDrive:面向闭环驾驶仿真的基于人类风格的检索增强VLA智能体

arXiv cs.AI · 2026-06-12 缓存

本文介绍了PersonaDrive,一种将视觉-语言-动作(VLA)驾驶智能体基于从风格引导的人类驾驶数据集中检索到的演示进行条件化的流程,从而能够为闭环仿真提供风格多样的非自车智能体,并在Bench2Drive上提升了驾驶评分。

0 人收藏 0 人点赞
#vla

@seclink: 5. 机器人世界模型开源加速 - NVIDIA Cosmos 3 + Isaac GR00T:物理 AI 基础模型 - AGIBOT Genie Sim 3.0:首个完全开源的机器人仿真平台(代码+数据+资产全开源) - VLA(Visi…

X AI KOLs Following · 2026-06-08 缓存

机器人世界模型和仿真平台迎来开源加速:NVIDIA 推出 Cosmos 3 与 Isaac GR00T 物理 AI 基础模型,AGIBOT 发布 Genie Sim 3.0 全开源仿真平台,VLA 模型成为操作策略主流,整体降低了机器人领域的入门门槛。

0 人收藏 0 人点赞
#vla

AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型

Hugging Face Daily Papers · 2026-06-04 缓存

AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。

0 人收藏 0 人点赞
#vla

机器人基础模型总是用微调后的数字来展示性能。Wall-OSS-0.5 正在尝试一种不同的方法

Reddit r/artificial · 2026-05-31

X Square Robot 发布了 Wall-OSS-0.5,这是一个 4B 参数的开源 VLA 机器人基础模型,在包含 17 个任务的真实机器人零样本测试集上进行了评估,无需任务特定的微调,旨在直接测量预训练能力。

0 人收藏 0 人点赞
#vla

开源权重VLA在17个真实机器人任务中的4个上实现了80%以上的任务进度,零微调。附带演示视频。

Reddit r/singularity · 2026-05-31

发布Wall-OSS-0.5,一个开源权重的视觉-语言-动作模型,在17个真实机器人任务中的4个上实现了超过80%的任务进度,且无需微调,包括一个预训练中未见过的可变形绳索任务。该模型在提升具身接地能力的同时,保留了通用的视觉-语言能力。

0 人收藏 0 人点赞
#vla

FrameSkip: 在VLA训练中从更少但信息更丰富的帧中学习

Hugging Face Daily Papers · 2026-05-13 缓存

FrameSkip是一种数据层的帧选择方法,通过基于动作变化和视觉一致性指标优先选择高重要性的帧,来改进视觉-语言-动作(VLA)策略训练。该方法在三个基准测试中实现了76.15%的宏观平均成功率,同时仅使用了20%的独特帧。

0 人收藏 0 人点赞
#vla

@dotey: https://x.com/dotey/status/2053351712149135385

X AI KOLs Timeline · 2026-05-10 缓存

英伟达 Jim Fan 在 Sequoia AI Ascent 2026 上发表演讲,宣告 VLA 架构过时并提出世界动作模型(WAM)作为机器人新范式,介绍了 DreamZero、EgoScale 及神经仿真器 Dream Dojo 等关键技术。

0 人收藏 0 人点赞
#vla

MolmoAct2:面向真实场景部署的动作推理模型

Papers with Code Trending · 2026-05-04 缓存

Allen AI 发布了 MolmoAct2,这是一款专为真实场景机器人部署设计的开放权重视觉-语言-动作模型,具备新数据集、开放动作分词器以及自适应推理以降低延迟等特性。

0 人收藏 0 人点赞
#vla

Gemma 4 VLA 在 Jetson Orin Nano Super 上的演示

Hugging Face Blog · 2026-04-22 缓存

NVIDIA 与 Hugging Face 发布实操演示,展示 Gemma 4 作为视觉-语言-动作模型在 Jetson Orin Nano Super 上完整运行,使用本地语音转文字/文字转语音及网络摄像头输入。

0 人收藏 0 人点赞
#vla

@zhijianliu_: 推理 VLA 会思考,只是不够快——直到现在。推出 FlashDrive:RTX PRO 6000 上 716 ms → 159 ms……

X AI KOLs Timeline · 2026-04-19 缓存

FlashDrive 将推理视觉-语言-动作模型在 RTX PRO 6000 上的延迟从 716 ms 降至 159 ms,最高加速 5.7 倍,零精度损失,让实时自主应用成为可能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈