标签
本文介绍了DECOWAM,一种用于腿式移动操作的解耦全身世界-动作模型,通过专用条件接口和新数据集,在视频和动作预测性能上优于现有模型如FastWAM。
Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。
本文介绍了面向LLM代理的记忆增强型推测执行技术,利用三种在线记忆系统在行动预测上提升19-39%的准确率,在观察预测上提升最高2.5倍,同时保持无损且零额外挂钟时间成本。
CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。
一个开放模型,通过控制信号预测机器人的动作,引发了一个问题:它到底是一个世界模型,还是一个视频生成器?
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
RoboSemanticBench 是一个基准测试,用于诊断视觉-语言-动作模型在动作预测中的语义基础,揭示机器人虽然能够抓取物体,但无法根据指令语义选择语义上正确的目标。
本文介绍了用于基于屏幕条件的动作预测的PiSAR基准,并将监督微调模型与前沿零样本基线进行了比较。关键发现表明,微调的Qwen3-VL-8B达到了0.783的语义相似度,显著优于Claude Opus 4.7和GPT-5.5(0.459和0.482),但同样的微调配方应用于更大的推理调优Gemma模型仅产生0.441,表明存在模型与配方不匹配的问题。
MementoGUI 提出了一种用于 GUI 代理的插件式智能体记忆框架,该框架使用学习到的控制器进行选择性记忆管理与检索,通过压缩的视觉与文本表示提升了长期任务的性能。