spatial-reasoning

标签

Cards List
#spatial-reasoning

SpatialSpeak:基于问答原生重建与局部和全局上下文的空间链式思考推理

Hugging Face Daily Papers ↗ · 2天前 缓存

SpatialSpeak 引入了一个两阶段框架,用于视觉语言模型中的空间推理,使用问答原生重建预训练和空间链式思考学习,以在基准测试中实现最先进的性能。

0 人收藏 0 人点赞
#spatial-reasoning

Astra 在 IKEA 家具组装中领先

Reddit r/singularity ↗ · 3天前 缓存

Epoch AI 创建了家具组装基准(FAB),用于测试 AI 模型在 IKEA 组装照片中识别错误的视觉推理能力。OpenAI 的 GPT-6 Astra 以 80% 的准确率领先,显示出比以往模型的大幅改进。

0 人收藏 0 人点赞
#spatial-reasoning

Spatial-Interactor: 通过与可观测物理世界的交互学习空间推理

arXiv cs.AI ↗ · 6天前 缓存

Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。

0 人收藏 0 人点赞
#spatial-reasoning

HarnessVLN:通过代理线束统一无训练实体导航

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。

0 人收藏 0 人点赞
#spatial-reasoning

Astra 在 Blueprint-bench2 上获得最高分

Reddit r/singularity ↗ · 2026-09-07

Astra 在 Blueprint-Bench 2 上获得最高分,这是一个测试 AI 智能体使用空间推理和跨公寓学习将公寓照片转换为精确 2D 平面图能力的基准测试。

0 人收藏 0 人点赞
#spatial-reasoning

@reach_vb: Astra 在 MazeBench 上以巨大优势达到最先进水平:

X AI KOLs Timeline ↗ · 2026-09-07 缓存

Astra 在 MazeBench 上取得了最先进的性能,在3D开放世界空间推理评估中显著超越了 GPT-6。

0 人收藏 0 人点赞
#spatial-reasoning

GPT-6 Astra 的 3D 建模能力远超我的预期

Reddit r/ArtificialInteligence ↗ · 2026-09-06

作者讨论了 GPT-6 Astra 在演示中展示的先进迭代式 3D 建模能力,包括对几何结构进行推理并逐步优化结果,并想知道是哪些技术变革推动了这一飞跃。

0 人收藏 0 人点赞
#spatial-reasoning

@BenjaminDEKR:Astra 对空间 / 3D 关系的理解优于其他主流模型,这也是它如此擅长 CAD、建模等任务的原因……

X AI KOLs Timeline ↗ · 2026-09-05 缓存

据称,Astra 在空间与 3D 理解方面超越了其他主流模型,在 VoxelBench 基准测试中排名第一,Elo 评分超过 2600 分,领先优势达 300 分以上。

0 人收藏 0 人点赞
#spatial-reasoning

TaichuAI/ZDTaichu5.0-9B

Hugging Face Models Trending ↗ · 2026-09-04 缓存

ZDTaichu5.0-9B 是一个多模态基础模型,结合了 Qwen3.5-9B 语言骨架和 C-RADIOv4-H 视觉编码器,在10B规模的视觉语言模型中擅长一般视觉理解、空间推理和代理任务。

0 人收藏 0 人点赞
#spatial-reasoning

RoboSPA:视觉-语言-动作模型能否超越简单场景和短期任务?

Hugging Face Daily Papers ↗ · 2026-09-04 缓存

本文介绍了RoboSPA,这是一个用于评估视觉-语言-动作模型在机器人操作中细粒度空间推理和长期过程规划能力的大规模基准测试。

0 人收藏 0 人点赞
#spatial-reasoning

Playco 使用 GPT-6 Astra 将游戏原型制作的手动修复减少50%

OpenAI Blog ↗ · 2026-09-03 缓存

Playco 使用 GPT-6 Astra 构建了 Playbot,这是一个面向游戏开发者的AI驱动IDE,将手动修复减少了50%,并提升了空间推理和原型制作效率。

0 人收藏 0 人点赞
#spatial-reasoning

展开世界:在强化空间推理中因子化4D属性

Hugging Face Daily Papers ↗ · 2026-09-03

本文介绍了FactoSR,一个因子化强化学习框架,通过将4D属性分解为正交子目标,增强了视觉-语言模型的空间推理能力,在多视角和视频基准测试中取得了显著的性能提升。

0 人收藏 0 人点赞
#spatial-reasoning

自回归马赛克:探测纯文本语言模型中的二维空间推理

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

介绍自回归马赛克(AM-Bench),一个用于评估纯文本大型语言模型是否具有真正的二维空间推理能力的基准,区别于代码生成。研究发现空间推理因模型而异,并受输出媒介如SVG与代码的影响。

0 人收藏 0 人点赞
#spatial-reasoning

UrbanGround:从局部感知到空间能动性在真实城市中的研究

Hugging Face Daily Papers ↗ · 2026-08-27 缓存

UrbanGround评估了多模态语言模型代理是否能在逼真的3D城市复制品中保持可靠的导航和空间推理能力,发现局部感知技能无法组合成扩展的目标导向行为。

0 人收藏 0 人点赞
#spatial-reasoning

AI 模型在这些智力测试中频频失手,你能做得更好吗?

MIT Technology Review ↗ · 2026-08-26 缓存

本文探讨了AI模型在空间推理和记忆谜题等智力测试中的表现不佳,突出了与人类认知的差距,并邀请读者测试自己的能力。

0 人收藏 0 人点赞
#spatial-reasoning

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

arXiv cs.CL ↗ · 2026-08-25 缓存

本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。

0 人收藏 0 人点赞
#spatial-reasoning

StateSight: 视觉语言模型中潜在空间状态重建的基准测试

arXiv cs.AI ↗ · 2026-08-24 缓存

StateSight是一个用于评估视觉语言模型空间状态重建的新基准,显示像GPT-5.5和Claude Sonnet 5这样的模型在空间推理任务上与人类表现相比存在困难。

0 人收藏 0 人点赞
#spatial-reasoning

一种用于CT扫描中可靠且可审计的空间关系验证的模块化代理

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

本文提出了一种模块化的医学成像代理,通过将任务分解为解析、定位和几何规则来验证CT扫描中的空间关系,实现了94.1%的准确率,并在基准测试中以42.5个百分点的优势超越了端到端视觉语言模型,同时确保了可审计的推理过程。

0 人收藏 0 人点赞
#spatial-reasoning

SPARGen: 通过原生多模态生成统一空间感知与推理

Hugging Face Daily Papers ↗ · 2026-08-14 缓存

SPARGen引入了一个统一的多模态框架,将3D重建、稠密对应和空间推理视为指令条件生成任务,从而实现共享空间表示。

0 人收藏 0 人点赞
#spatial-reasoning

Spatial Memory Agent:基于经验的过程记忆用于空间智能

Hugging Face Daily Papers ↗ · 2026-08-13 缓存

本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈