@FeitengLi: 早上才说:具身智能的智能 应该抄 LLM + RL + Agentic 作业 这就来了:Agentic VLA 全线碾压头部具身公司的模型 https://x.com/FeitengLi/status/205909864717506193…
摘要
提出 Agentic-VLA 框架,将智能体引入 VLA 循环中,使视觉-语言-动作模型能够自我进化,并在各项指标上超越现有头部具身模型。
查看缓存全文
缓存时间: 2026/05/26 23:15
早上才说:具身智能的智能 应该抄 LLM + RL + Agentic 作业 这就来了:Agentic VLA 全线碾压头部具身公司的模型 https://x.com/FeitengLi/status/2059098647175061939…
Zaixi Zhang (@ZaixiZhang): Giving VLAs the ability to self-evolve.
We introduce Agentic-VLA, a framework for the co-evolution of agents and vision-language-action models.
Instead of treating VLA as a fixed execution model, Agentic-VLA brings agents into the learning loop: task decomposition, reward
相似文章
@FeitengLi: 动手搭了一个 ReAct agent 系统:围绕 LLM 做 agent 系统 傍晚散步时在想:如何训练 LLM 的 agentic 能力、数据准备、模型训练、agent 轨迹 action 构造 RL 训练,再想 Claude 在过去一…
作者分享了搭建 ReAct agent 系统的经验,并介绍了智谱 AI 发布的 GLM-5 技术报告,该模型在 agentic、推理和编码方面取得了突破。
从基础到应用:在实践中改进VLA模型
本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。
AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
机器人需要的不仅仅是VLA和世界模型
本文立场论文认为,推进机器人智能需要将非结构化的行为数据通过专门的接口进行整合,用于标注、具身映射、世界建模和奖励推断,而不是仅仅依赖扩展视觉-语言-动作(VLA)模型和世界模型。