multimodal-foundation-models

标签

Cards List
#multimodal-foundation-models

具身操作的数据金字塔

Hugging Face Daily Papers · 2026-07-27 缓存

本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。

0 人收藏 0 人点赞
#multimodal-foundation-models

GGT-100K:可泛化真实图像修复的生成式真实标注

Hugging Face Daily Papers · 2026-05-29 缓存

本文介绍了GGT-100K,一个包含103,707对图像的真实图像修复数据集,通过使用如Nano-Banana-2等多模态基础模型,从低质量输入生成高质量目标。实验表明,该数据集提升了多种图像修复模型的泛化能力。

0 人收藏 0 人点赞
#multimodal-foundation-models

WildTableBench:在真实场景中评估多模态基础模型的表格理解能力

Hugging Face Daily Papers · 2026-05-01 缓存

WildTableBench 提出了首个针对真实世界表格图像的问答应答基准,揭示了现有多模态基础模型在结构感知和数值推理方面存在显著困难,仅有1个模型准确率超过50%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈