spatial-reasoning

标签

Cards List
#spatial-reasoning

StateSight: 视觉语言模型中潜在空间状态重建的基准测试

arXiv cs.AI ↗ · 2026-08-24 缓存

StateSight是一个用于评估视觉语言模型空间状态重建的新基准,显示像GPT-5.5和Claude Sonnet 5这样的模型在空间推理任务上与人类表现相比存在困难。

0 人收藏 0 人点赞
#spatial-reasoning

一种用于CT扫描中可靠且可审计的空间关系验证的模块化代理

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

本文提出了一种模块化的医学成像代理,通过将任务分解为解析、定位和几何规则来验证CT扫描中的空间关系,实现了94.1%的准确率,并在基准测试中以42.5个百分点的优势超越了端到端视觉语言模型,同时确保了可审计的推理过程。

0 人收藏 0 人点赞
#spatial-reasoning

SPARGen: 通过原生多模态生成统一空间感知与推理

Hugging Face Daily Papers ↗ · 2026-08-14 缓存

SPARGen引入了一个统一的多模态框架,将3D重建、稠密对应和空间推理视为指令条件生成任务,从而实现共享空间表示。

0 人收藏 0 人点赞
#spatial-reasoning

Spatial Memory Agent:基于经验的过程记忆用于空间智能

Hugging Face Daily Papers ↗ · 2026-08-13 缓存

本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。

0 人收藏 0 人点赞
#spatial-reasoning

@MSFTResearch:一条路径、一道栅栏、一个结。MindTopo为测试AI如何理解拓扑关系设定了新基准,并…

X AI KOLs Timeline ↗ · 2026-08-12 缓存

微软研究院推出MindTopo基准,用于测试多模态AI模型是否理解连通性、包围和打结等拓扑关系。当前模型在静态识别上表现良好,但在交互式规划任务上存在困难,这揭示了机器人和交互式环境中的关键差距。

0 人收藏 0 人点赞
#spatial-reasoning

工具增强空间推理中的自进化神经符号技能

arXiv cs.AI ↗ · 2026-08-11 缓存

提出了NeSy-Spatial,一种神经符号框架,通过组合工具使用技能和几何技能来自我进化空间推理技能,提高了空间推理基准的准确性。

0 人收藏 0 人点赞
#spatial-reasoning

LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

arXiv cs.AI ↗ · 2026-08-10 缓存

This paper proposes a modality transfer task for Large Multimodal Models (LMMs) in GIS workflows and finds that current OpenAI LMMs struggle to transfer spatial information between image and text modalities, highlighting a critical bottleneck for autonomous GIS agents.

0 人收藏 0 人点赞
#spatial-reasoning

Capek 0.5:面向具身智能的以执行为中心的视觉-语言模型

arXiv cs.AI ↗ · 2026-08-10 缓存

本文介绍了 Capek 0.5,一个以执行能力分类法为核心的具身视觉-语言模型,通过强化学习进行专家训练,随后采用权重空间融合和路由策略空间蒸馏。它提出了一个新的状态验证基准,并在2B和35B-A3B规模上展示了在具身和通用能力上的强劲性能。

0 人收藏 0 人点赞
#spatial-reasoning

360CityArena:面向具身智能体的逼真虚拟城市导航基准

Hugging Face Daily Papers ↗ · 2026-08-09 缓存

360CityArena 是一个基于东京秋叶原地区360度视频构建的照片级逼真城市导航基准。它评估具身智能体的环境理解、路径推理和空间推理能力,结果表明,即使是像 Gemini 2.5 Flash 这样强大的基于LMM的智能体,其表现也远低于人类水平。

0 人收藏 0 人点赞
#spatial-reasoning

将3D建模与空间推理解耦

arXiv cs.LG ↗ · 2026-08-07 缓存

本文提出DiSR,一个将3D感知与推理分离的框架,利用现成的感知模型重建显式3D证据,并通过LoRA微调LLM进行空间推理,在提升可解释性和效率的同时取得了具有竞争力的性能。

0 人收藏 0 人点赞
#spatial-reasoning

SpatialCLI:先使用空间工具推理,再脱离工具

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。

0 人收藏 0 人点赞
#spatial-reasoning

我正在组织ICFP编程竞赛(2026年)

Lobsters Hottest ↗ · 2026-07-25 缓存

作者宣布他们将举办第29届年度ICFP编程竞赛,该竞赛推出了一种名为“littleman”的新语言,旨在强调空间推理并挑战AI智能体。

0 人收藏 0 人点赞
#spatial-reasoning

展示而非讲述:在生成像素而非LLM文本中评估空间认知

Hugging Face Daily Papers ↗ · 2026-07-23 缓存

提出了ProVisE,一个与基准无关的框架,用于利用像素空间输出评估图像生成模型的空间认知,并引入了SpatialGen-Bench,用于跨14个空间子任务的统一评估。

0 人收藏 0 人点赞
#spatial-reasoning

RynnBrain 1.1:迈向更强大、更具泛化能力的具身基础模型

Hugging Face Daily Papers ↗ · 2026-07-20 缓存

RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。

0 人收藏 0 人点赞
#spatial-reasoning

MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准

arXiv cs.AI ↗ · 2026-07-13 缓存

MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。

0 人收藏 0 人点赞
#spatial-reasoning

SpaR3D-MoE: 面向稀疏视图的自适应3D空间推理与几何归纳混合专家模型

arXiv cs.AI ↗ · 2026-07-09 缓存

介绍SpaR3D-MoE,这是一个端到端框架,用于从稀疏RGB视图中进行自适应3D空间推理,利用流形采样和几何归纳混合专家,在VSI-Bench、ScanQA和SQA3D上取得了最先进的性能。

0 人收藏 0 人点赞
#spatial-reasoning

多语言视觉-语言模型中使用空间指示表达的能力评估

arXiv cs.CL ↗ · 2026-07-09 缓存

本文开发了一个基准,用于评估视觉-语言模型在多语言环境中使用空间指示表达(如'this'、'that')的能力,涵盖四种语言。实验揭示,模型在基于距离选择适当指示词方面与人类存在差异。

0 人收藏 0 人点赞
#spatial-reasoning

MentalThink:在Mental SVG World中塑造思维

arXiv cs.AI ↗ · 2026-07-07 缓存

MentalThink 引入了一种视觉-符号推理范式,用于多模态大语言模型(MLLMs),该范式使用SVG代码作为中间视觉表示进行多轮推理。通过SFT和RL的两阶段训练,在空间推理基准上取得了出色表现。

0 人收藏 0 人点赞
#spatial-reasoning

MentalThink:在心理SVG世界中塑造思维

Hugging Face Daily Papers ↗ · 2026-07-03 缓存

MentalThink使多模态大语言模型能够通过生成和解释SVG代码作为中间表示来执行视觉符号推理,以解决空间问题。

0 人收藏 0 人点赞
#spatial-reasoning

通过语言与符号表示之间的模态切换进行空间推理

arXiv cs.AI ↗ · 2026-07-01 缓存

本文探讨了将多跳文本-空间故事嵌入到几何感知模态(如网格)中的方法,展示了从纯语言推理切换到基于网格的推理时性能提升42%,并引入了一种用于LLM模态选择的切换度量。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈