vla

标签

Cards List
#vla

Unitree 刚发布 UnifoLM-WLA-1.0 —— 一个 6B 模型即可在真实人形机器人上完成 64 项全身与桌面任务

Reddit r/LocalLLaMA ↗ · 2天前

Unitree 发布了 UnifoLM-WLA-1.0,一个 6B 参数的全身视觉-语言-动作基础模型,基于约 2500 小时的真实机器人数据训练,可在 Unitree G1 人形机器人上完成 64 项任务。其架构基于 Qwen3-VL 构建的具身推理器,并在其上叠加 MMDiT 动作专家。

0 人收藏 0 人点赞
#vla

VLA的层级之谜:VLA潜空间接口的信息论分析

arXiv cs.AI ↗ · 5天前 缓存

本文分析了VLA策略应如何选择哪些骨干层来构成潜空间接口,发现层级融合的效果往往不如最佳单一层,并提出以InfoNCE作为计算高效的层选择代理,可在降低选择遗憾的同时将GPU成本削减9-33倍。

0 人收藏 0 人点赞
#vla

WorldAuditBench:基于多模态智能体的交互式3D世界审计

Hugging Face Daily Papers ↗ · 5天前 缓存

WorldAuditBench 是一个包含213个异常审计任务的基准,涵盖13个基于 Unreal Engine 5 / Three.js 构建的交互式3D环境,用于评估多模态智能体能否将动作与视觉推理有效耦合。前沿模型的成功率仅为6.6%–42.3%,远低于人类的83.4%,凸显出当前在证据收集与解读方面的局限性。

0 人收藏 0 人点赞
#vla

像世界模型一样思考,像VLA一样行动:将世界模型表示蒸馏到紧凑的机器人策略中

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

本文介绍了THAW-VLA,一种将世界模型表示蒸馏到视觉-语言-动作模型中的方法,用于机器人学,增强了在模拟和真实硬件上的鲁棒性和性能,而不会增加推理开销。

0 人收藏 0 人点赞
#vla

VSArena v0.6.0 — 一款用于在浏览器中运行和审查具身AI策略的新工作室

Reddit r/artificial ↗ · 2026-09-10

VSArena v0.6.0是这款浏览器内工作室的重大更新,用于在3D物理环境中运行和评估视觉-语言-动作策略,强调无需本地模拟器或实体机器人即可进行可靠、可复现的评估。

0 人收藏 0 人点赞
#vla

@seclink: 新仓库:Awesome Egocentric Dataset — 一份精选的第一人称视觉数据集列表,超越经典的 Ego…

X AI KOLs Timeline ↗ · 2026-08-19 缓存

一个新的开源仓库精选了一份第一人称视觉数据集列表,更新以包括2023–2026年的最新版本,并添加了关于VLA论文的部分,同时移除了损坏的链接。

0 人收藏 0 人点赞
#vla

未见先觉:世界行动模型的潜在未来

arXiv cs.AI ↗ · 2026-08-13 缓存

提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。

0 人收藏 0 人点赞
#vla

@AdinaYakup: Xiaomi Robotics-1,来自@XiaomiTech_ 的新机器人基础模型 - 10万+小时真实世界机器人数据 - VLA架构…

X AI KOLs Following ↗ · 2026-08-05 缓存

小米宣布推出Robotics-1,这是一种采用VLA架构的新型机器人基础模型,基于超过10万小时的真实世界机器人数据进行训练,具备跨本体泛化和快速适应新任务的能力。

0 人收藏 0 人点赞
#vla

从世界到手腕:面向精细机器人操作的任务条件未来手腕建模

Hugging Face Daily Papers ↗ · 2026-08-05 缓存

介绍了W2-VLA,一种用于精细机器人操作的视觉-语言-动作模型,该模型对任务条件下的未来手腕观测进行建模,在基准测试和真实世界任务中实现了改进的操作性能。

0 人收藏 0 人点赞
#vla

@songhan_mit:探索 VLASH:通过未来状态感知异步推理实现的实时 VLA

X AI KOLs Following ↗ · 2026-07-28 缓存

MIT 研究人员开发了 VLASH,这是一种使视觉-语言-动作模型能够预测未来机器人状态的方法,在拾取放置和乒乓球等任务中速度加倍并减少延迟。

0 人收藏 0 人点赞
#vla

基于表示锚定与语言-动作对齐的泛化VLA微调

Hugging Face Daily Papers ↗ · 2026-07-15 缓存

Anchor-Align通过视觉-语言锚定增强行为克隆,以保留预训练表示和语言-动作对齐,在xArm7上使真实机器人成功率提升超过20%,并在模拟基准测试中持续取得改进。

0 人收藏 0 人点赞
#vla

CLAP:通过语言-动作对齐实现从VLM到VLA的直接适配

arXiv cs.AI ↗ · 2026-07-13 缓存

CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。

0 人收藏 0 人点赞
#vla

像机器人一样看:面向视觉-语言-动作模型的机器人中心点云图

Hugging Face Daily Papers ↗ · 2026-07-13 缓存

本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。

0 人收藏 0 人点赞
#vla

@robbyant_brain: LingBot-VLA 2.0 现已开源——我们新一代的具身基础模型。6万小时高质量预训练数据…

X AI KOLs Timeline ↗ · 2026-07-07 缓存

LingBot-VLA 2.0,一个开源的具身基础模型,已发布,拥有6万小时预训练数据,支持17个品牌的20种机器人配置,在RTX 4090上推理时间低于130毫秒。

0 人收藏 0 人点赞
#vla

@svlevine:要想让机器人做好一件事,你需要知道如何与它对话。如果你不会,你可以学习,通过Semanti…

X AI KOLs Following ↗ · 2026-07-03 缓存

本文介绍了语义动作强化学习(Semantic Action RL),它通过对视觉-语言-动作(VLA)提示进行强化学习,使机器人能够在现实世界中快速学习新任务。

0 人收藏 0 人点赞
#vla

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

arXiv cs.AI ↗ · 2026-06-24 缓存

介绍了Neuro-Symbolic Drive,一个使用来自经典规划器的基于规则推理轨迹来微调驾驶VLA(Qwen3.5-4B)的框架,与标准CoT推理相比,显著降低了平均位移误差和漏检率。

0 人收藏 0 人点赞
#vla

PersonaDrive:面向闭环驾驶仿真的基于人类风格的检索增强VLA智能体

arXiv cs.AI ↗ · 2026-06-12 缓存

本文介绍了PersonaDrive,一种将视觉-语言-动作(VLA)驾驶智能体基于从风格引导的人类驾驶数据集中检索到的演示进行条件化的流程,从而能够为闭环仿真提供风格多样的非自车智能体,并在Bench2Drive上提升了驾驶评分。

0 人收藏 0 人点赞
#vla

@seclink: 5. 机器人世界模型开源加速 - NVIDIA Cosmos 3 + Isaac GR00T:物理 AI 基础模型 - AGIBOT Genie Sim 3.0:首个完全开源的机器人仿真平台(代码+数据+资产全开源) - VLA(Visi…

X AI KOLs Following ↗ · 2026-06-08 缓存

机器人世界模型和仿真平台迎来开源加速:NVIDIA 推出 Cosmos 3 与 Isaac GR00T 物理 AI 基础模型,AGIBOT 发布 Genie Sim 3.0 全开源仿真平台,VLA 模型成为操作策略主流,整体降低了机器人领域的入门门槛。

0 人收藏 0 人点赞
#vla

AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型

Hugging Face Daily Papers ↗ · 2026-06-04 缓存

AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。

0 人收藏 0 人点赞
#vla

机器人基础模型总是用微调后的数字来展示性能。Wall-OSS-0.5 正在尝试一种不同的方法

Reddit r/artificial ↗ · 2026-05-31

X Square Robot 发布了 Wall-OSS-0.5,这是一个 4B 参数的开源 VLA 机器人基础模型,在包含 17 个任务的真实机器人零样本测试集上进行了评估,无需任务特定的微调,旨在直接测量预训练能力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈