vision-language-action

标签

Cards List
#vision-language-action

MemBodied:用于视觉-语言-动作模型的循环联想记忆

Hugging Face Daily Papers ↗ · 2天前 缓存

MemBodied 引入了一种具有联想状态和情节锚点的固定大小情景记忆,旨在增强视觉-语言-动作模型在历史依赖型操作任务中的能力,并显著超越了基线方法的性能。

0 人收藏 0 人点赞
#vision-language-action

@svlevine: 如何使用实时分块(RTC)运行强化学习?在这项工作中,我们找到了方法,用小型强化学习策略配合大型机器人基础模型……

X AI KOLs Following ↗ · 3天前 缓存

一项研究合作介绍了ARLI,这是一种通过异步推理使用实时分块来启用视觉-语言-动作模型的强化学习微调的方法,通过让强化学习策略观察更近期的图像来改善机器人行为。

0 人收藏 0 人点赞
#vision-language-action

@askalphaxiv: “实时视觉-语言-动作策略的强化学习” VLA 模型通常对实时机器人控制来说太慢...

X AI KOLs Following ↗ · 4天前 缓存

本文介绍了一种方法,将视觉-语言-动作模型中的动作生成分离为慢层和快层,从而实现实时反应式机器人控制,并将成功率从42%提高到97%,仅需10分钟的在线数据。

0 人收藏 0 人点赞
#vision-language-action

像世界模型一样思考,像VLA一样行动:将世界模型表示蒸馏到紧凑的机器人策略中

Hugging Face Daily Papers ↗ · 4天前 缓存

本文介绍了THAW-VLA,一种将世界模型表示蒸馏到视觉-语言-动作模型中的方法,用于机器人学,增强了在模拟和真实硬件上的鲁棒性和性能,而不会增加推理开销。

0 人收藏 0 人点赞
#vision-language-action

CARE:面向视觉-语言-动作策略的经验引导原子纠正执行

Hugging Face Daily Papers ↗ · 4天前 缓存

CARE是一个面向视觉-语言-动作策略的框架,通过从执行失败中学习生成纠正动作来增强机器人操作,在模拟和现实世界任务中展示了成功率的提升。

0 人收藏 0 人点赞
#vision-language-action

@Official_m9g: 凭此项目赢得Gemini 3首尔黑客松(硬科技):照片 → 图 → 文字布局 → 地图 → 航点。透视图像……

X AI KOLs Timeline ↗ · 4天前 缓存

GeminiSpace,一款基于Google Gemini的自主室内导航系统,在Gemini 3首尔黑客松中荣获一等奖,其功能是将全景照片转化为可导航地图及机器人路径。

0 人收藏 0 人点赞
#vision-language-action

HuRo:用于可扩展VLA预训练的机器人化人类视频

Hugging Face Daily Papers ↗ · 2026-09-18 缓存

本文介绍了HuRo,一个将人类视频机器人化以创建可扩展VLA预训练数据的流程,展示了在真实世界操作任务中任务完成率和鲁棒性的显著提升。

0 人收藏 0 人点赞
#vision-language-action

ActionPiece:重新思考自回归视觉-语言-动作模型中的动作分词

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

本文介绍了ActionPiece,一种用于自回归视觉-语言-动作模型的新型动作分词方法,该方法利用物理秩一致性来提高动作关系的保真度,并在LIBERO和SimplerEnv等基准测试中进行了评估。

0 人收藏 0 人点赞
#vision-language-action

用于分块视觉-语言-动作模型的时频几何交叉注意力

arXiv cs.AI ↗ · 2026-09-11 缓存

本文提出时频几何交叉注意力(TFGCA),这是一种即插即用模块,用于分块视觉-语言-动作模型,通过将分块分解为时频表示并捕捉几何关系来改进动作轨迹预测,从而在基准测试和真实机器人任务中实现显著性能提升。

0 人收藏 0 人点赞
#vision-language-action

Dynin-Robotics:多模态统一扩散视觉-语言-动作模型

Hugging Face Daily Papers ↗ · 2026-09-11 缓存

Dynin-Robotics是一个多模态统一扩散模型,整合了视觉、语言和动作,用于语言条件下的机器人控制,通过联合去噪和测试时缩放提高适应性和成功率。

0 人收藏 0 人点赞
#vision-language-action

LayerRoute:基于动作条件的混合层路由用于视觉-语言-动作策略

arXiv cs.AI ↗ · 2026-09-10 缓存

LayerRoute 为视觉-语言-动作策略引入了一种动作条件路由接口,该接口动态调整对 VLM 层表示的访问,以最小的额外参数提升机器人操作性能。

0 人收藏 0 人点赞
#vision-language-action

会思考的机器:具身智能(10分钟阅读)

TLDR AI ↗ · 2026-09-08 缓存

本文批判了那种认为在人工智能突破后机器人学仅仅是一个集成问题的简化观点,强调了训练数据稀缺和视觉语言动作模型泛化能力的挑战。它将这些限制与通过传统自动化实现的专门工业机器人的可靠性进行了对比。

0 人收藏 0 人点赞
#vision-language-action

测量机器人策略中的语言迁移:将希腊语添加到Cosmos3视觉-语言-动作策略

Hugging Face Daily Papers ↗ · 2026-09-07

本研究探讨将希腊语添加到Cosmos3视觉-语言-动作机器人策略中,揭示了测量方面的挑战,并表明双语训练能提升性能但会过拟合到翻译者的措辞。结果强调了在低资源本地化中建立空基线和种子复制的必要性。

0 人收藏 0 人点赞
#vision-language-action

MobileVLA-R1 2.0:强化学习增强的移动机器人控制推理

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

MobileVLA-R1 2.0是一个强化学习增强的视觉-语言-动作框架,将结构化推理与移动机器人控制相结合,在真实平台上的长期指令跟随方面取得了改进。

0 人收藏 0 人点赞
#vision-language-action

ShieldVLA:基于可行性感知的视觉-语言-动作模型安全对齐

Hugging Face Daily Papers ↗ · 2026-09-02 缓存

ShieldVLA 提出了一种用于视觉-语言-动作模型的安全对齐微调框架,使用 Hamilton-Jacobi 可达性来估计安全操作区域,将安全成本降低57%并提高机器人基准测试中的任务成功率。

0 人收藏 0 人点赞
#vision-language-action

SimpleMemVLA:一种简单但有效的视觉-语言-动作模型原生视频记忆

Hugging Face Daily Papers ↗ · 2026-09-02 缓存

SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。

0 人收藏 0 人点赞
#vision-language-action

StreamPI: 视觉-语言-动作模型的流式多模态时序建模

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

StreamPI 引入了一个流式多模态时序建模框架,用于视觉-语言-动作模型,通过指令锚定注意力和随机间隔训练来改进机器人操作,无需额外参数。

0 人收藏 0 人点赞
#vision-language-action

MA-VLA:面向协作与组合泛化的多臂视觉-语言-动作模型

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

MA-VLA 是一个用于多臂机器人协作的统一框架,它将协作行为分解为原子提示,并在训练时进行排列(Arm Shuffle)以实现对未见协调模式的泛化。

0 人收藏 0 人点赞
#vision-language-action

ForeTime-VLA:基于世界动作模型的因果未来令牌蒸馏在传送带操作中的应用

arXiv cs.AI ↗ · 2026-08-24 缓存

ForeTime-VLA引入了一种从世界动作模型中提取因果未来令牌的蒸馏方法,以提高动态传送带操作的性能,与现有VLA策略相比,实现了更高的抓取成功率。

0 人收藏 0 人点赞
#vision-language-action

有意图的行动:蒸馏视觉-语言-动作模型的行为意图

Hugging Face Daily Papers ↗ · 2026-08-24 缓存

本文提出意图蒸馏 (INDI),将行为意图蒸馏到视觉-语言-动作模型的动作解码器中,从而在SimplerEnv-Bridge等基准测试和现实世界任务中提高了性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈