3d-reasoning

标签

Cards List
#3d-reasoning

CoVeR:用于视觉语言模型多视角3D推理的基于覆盖的令牌剪枝技术

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

CoVeR 是一种无需训练的空间令牌选择器,通过强制执行精确的令牌预算和全面的场景覆盖,提高视觉语言模型中的3D推理能力,超越了先前的最先进方法。

0 人收藏 0 人点赞
#3d-reasoning

SpatialBlock: 通过合成堆叠方块问题增强LVLMs中的空间智能

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

本文介绍了SpatialBlock-15k,这是一个针对堆叠方块问题的合成数据集,旨在提升大型视觉语言模型中的3D空间推理能力,并展示了性能的改进和对现实世界任务的泛化能力。

0 人收藏 0 人点赞
#3d-reasoning

SpaR3D-MoE: 面向稀疏视图的自适应3D空间推理与几何归纳混合专家模型

arXiv cs.AI ↗ · 2026-07-09 缓存

介绍SpaR3D-MoE,这是一个端到端框架,用于从稀疏RGB视图中进行自适应3D空间推理,利用流形采样和几何归纳混合专家,在VSI-Bench、ScanQA和SQA3D上取得了最先进的性能。

0 人收藏 0 人点赞
#3d-reasoning

历经考验:在陌生环境中重新评估智能体的能力

Hugging Face Daily Papers ↗ · 2026-06-25 缓存

GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。

0 人收藏 0 人点赞
#3d-reasoning

基于全局地图与局部视图的多视角3D推理的密集奖励

Hugging Face Daily Papers ↗ · 2026-06-22 缓存

DR-MV3D 提出了一种基于地图的强化学习框架,通过密集奖励来改进多视角3D视觉问答能力,其核心包括全局地图构建、视角轨迹规划和自我中心定位。

0 人收藏 0 人点赞
#3d-reasoning

Geometric Action Model 用于机器人策略学习

Hugging Face Daily Papers ↗ · 2026-06-15 缓存

Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。

0 人收藏 0 人点赞
#3d-reasoning

SpatialClaw: 重新思考智能体空间推理的动作接口

Hugging Face Daily Papers ↗ · 2026-06-11 缓存

SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。

0 人收藏 0 人点赞
#3d-reasoning

MolmoAct 2

Product Hunt ↗ · 2026-05-05

MolmoAct 2 是由 Allen Institute for Artificial Intelligence 开发的开源机器人模型,能够在执行动作前进行三维空间推理。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈