action-prediction

标签

Cards List
#action-prediction

DECOWAM:用于腿式移动操作的解耦全身世界-动作模型

arXiv cs.AI · 2026-08-21 缓存

本文介绍了DECOWAM,一种用于腿式移动操作的解耦全身世界-动作模型,通过专用条件接口和新数据集,在视频和动作预测性能上优于现有模型如FastWAM。

0 人收藏 0 人点赞
#action-prediction

Black Forest Lab's Flux 3: 全模态用于图像、视频、音频和动作预测

Reddit r/singularity · 2026-07-23

Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。

0 人收藏 0 人点赞
#action-prediction

基于记忆的推测:LLM代理的无损加速

arXiv cs.LG · 2026-07-15 缓存

本文介绍了面向LLM代理的记忆增强型推测执行技术,利用三种在线记忆系统在行动预测上提升19-39%的准确率,在观察预测上提升最高2.5倍,同时保持无损且零额外挂钟时间成本。

0 人收藏 0 人点赞
#action-prediction

CLAP:通过语言-动作对齐实现从VLM到VLA的直接适配

arXiv cs.AI · 2026-07-13 缓存

CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。

0 人收藏 0 人点赞
#action-prediction

一个开放模型,通过控制信号预测机器人的动作。角落面板展示给定的动作和手部姿态,其余部分为模型想象。这是世界模型,还是仅仅是一个视频生成器?

Reddit r/singularity · 2026-07-12

一个开放模型,通过控制信号预测机器人的动作,引发了一个问题:它到底是一个世界模型,还是一个视频生成器?

0 人收藏 0 人点赞
#action-prediction

Light-WAM:基于状态融合动作解码的高效世界动作模型

Hugging Face Daily Papers · 2026-06-06 缓存

Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。

0 人收藏 0 人点赞
#action-prediction

RoboSemanticBench:诊断VLA模型动作预测中的语义基础

Hugging Face Daily Papers · 2026-06-01 缓存

RoboSemanticBench 是一个基准测试,用于诊断视觉-语言-动作模型在动作预测中的语义基础,揭示机器人虽然能够抓取物体,但无法根据指令语义选择语义上正确的目标。

0 人收藏 0 人点赞
#action-prediction

架构敏感的监督微调用于基于屏幕条件的动作预测:PiSAR基准

arXiv cs.AI · 2026-05-29 缓存

本文介绍了用于基于屏幕条件的动作预测的PiSAR基准,并将监督微调模型与前沿零样本基线进行了比较。关键发现表明,微调的Qwen3-VL-8B达到了0.783的语义相似度,显著优于Claude Opus 4.7和GPT-5.5(0.459和0.482),但同样的微调配方应用于更大的推理调优Gemma模型仅产生0.441,表明存在模型与配方不匹配的问题。

0 人收藏 0 人点赞
#action-prediction

MementoGUI:学习智能体多模态记忆控制以支持长时域GUI代理

Hugging Face Daily Papers · 2026-05-18 缓存

MementoGUI 提出了一种用于 GUI 代理的插件式智能体记忆框架,该框架使用学习到的控制器进行选择性记忆管理与检索,通过压缩的视觉与文本表示提升了长期任务的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈