spatial-reasoning

标签

Cards List
#spatial-reasoning

空间策略而非动作:向量量化测地线作为 LLM 驱动智能体的工具

arXiv cs.AI ↗ · 2天前 缓存

本文提出了一种 LLM 驱动的智能体架构,将向量量化的测地线轨迹转化为可复用的工具,使快速的非推理模型能够达到链式思维(chain-of-thought)的性能,同时将决策延迟从分钟级降低到秒级。

0 人收藏 0 人点赞
#spatial-reasoning

软空间推理(Soft Spatial Reasoning)

Hugging Face Daily Papers ↗ · 4天前 缓存

本文提出 Soft Spatial Reasoning,一个针对大型视觉-语言模型(LVLM)空间任务的后训练框架,其引入自适应的"软思考"机制:在中间推理步骤中混合 token 嵌入,而非直接选定某个离散 token。AdaptSoft 控制器会根据隐藏状态与预测不确定性动态调整软化程度,在多个空间推理基准上超越了硬思考(hard)与固定软化程度的 CoT 基线。

0 人收藏 0 人点赞
#spatial-reasoning

SpatialCORE:大型视觉-语言模型中置信度感知的接地空间推理

Hugging Face Daily Papers ↗ · 4天前 缓存

SpatialCORE 是一个后训练框架,将模型对其生成的边界框接地的置信度用作大型视觉-语言模型进行空间推理的学习信号,在空间推理基准测试中取得了开源模型中的最先进结果。

0 人收藏 0 人点赞
#spatial-reasoning

LeRF:学习用于视角转换推理的参考坐标系

Hugging Face Daily Papers ↗ · 6天前 缓存

LeRF 引入了一种方法,通过学习参考坐标系来增强视觉语言模型中的视角转换推理,通过监督微调和强化学习提高了在基准测试上的性能。

0 人收藏 0 人点赞
#spatial-reasoning

SpatialSpeak:基于问答原生重建与局部和全局上下文的空间链式思考推理

Hugging Face Daily Papers ↗ · 2026-09-27 缓存

SpatialSpeak 引入了一个两阶段框架,用于视觉语言模型中的空间推理,使用问答原生重建预训练和空间链式思考学习,以在基准测试中实现最先进的性能。

0 人收藏 0 人点赞
#spatial-reasoning

Astra 在 IKEA 家具组装中领先

Reddit r/singularity ↗ · 2026-09-26 缓存

Epoch AI 创建了家具组装基准(FAB),用于测试 AI 模型在 IKEA 组装照片中识别错误的视觉推理能力。OpenAI 的 GPT-6 Astra 以 80% 的准确率领先,显示出比以往模型的大幅改进。

0 人收藏 0 人点赞
#spatial-reasoning

Spatial-Interactor: 通过与可观测物理世界的交互学习空间推理

arXiv cs.AI ↗ · 2026-09-23 缓存

Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。

0 人收藏 0 人点赞
#spatial-reasoning

HarnessVLN:通过代理线束统一无训练实体导航

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。

0 人收藏 0 人点赞
#spatial-reasoning

Astra 在 Blueprint-bench2 上获得最高分

Reddit r/singularity ↗ · 2026-09-07

Astra 在 Blueprint-Bench 2 上获得最高分,这是一个测试 AI 智能体使用空间推理和跨公寓学习将公寓照片转换为精确 2D 平面图能力的基准测试。

0 人收藏 0 人点赞
#spatial-reasoning

@reach_vb: Astra 在 MazeBench 上以巨大优势达到最先进水平:

X AI KOLs Timeline ↗ · 2026-09-07 缓存

Astra 在 MazeBench 上取得了最先进的性能,在3D开放世界空间推理评估中显著超越了 GPT-6。

0 人收藏 0 人点赞
#spatial-reasoning

GPT-6 Astra 的 3D 建模能力远超我的预期

Reddit r/ArtificialInteligence ↗ · 2026-09-06

作者讨论了 GPT-6 Astra 在演示中展示的先进迭代式 3D 建模能力,包括对几何结构进行推理并逐步优化结果,并想知道是哪些技术变革推动了这一飞跃。

0 人收藏 0 人点赞
#spatial-reasoning

@BenjaminDEKR:Astra 对空间 / 3D 关系的理解优于其他主流模型,这也是它如此擅长 CAD、建模等任务的原因……

X AI KOLs Timeline ↗ · 2026-09-05 缓存

据称,Astra 在空间与 3D 理解方面超越了其他主流模型,在 VoxelBench 基准测试中排名第一,Elo 评分超过 2600 分,领先优势达 300 分以上。

0 人收藏 0 人点赞
#spatial-reasoning

TaichuAI/ZDTaichu5.0-9B

Hugging Face Models Trending ↗ · 2026-09-04 缓存

ZDTaichu5.0-9B 是一个多模态基础模型,结合了 Qwen3.5-9B 语言骨架和 C-RADIOv4-H 视觉编码器,在10B规模的视觉语言模型中擅长一般视觉理解、空间推理和代理任务。

0 人收藏 0 人点赞
#spatial-reasoning

RoboSPA:视觉-语言-动作模型能否超越简单场景和短期任务?

Hugging Face Daily Papers ↗ · 2026-09-04 缓存

本文介绍了RoboSPA,这是一个用于评估视觉-语言-动作模型在机器人操作中细粒度空间推理和长期过程规划能力的大规模基准测试。

0 人收藏 0 人点赞
#spatial-reasoning

Playco 使用 GPT-6 Astra 将游戏原型制作的手动修复减少50%

OpenAI Blog ↗ · 2026-09-03 缓存

Playco 使用 GPT-6 Astra 构建了 Playbot,这是一个面向游戏开发者的AI驱动IDE,将手动修复减少了50%,并提升了空间推理和原型制作效率。

0 人收藏 0 人点赞
#spatial-reasoning

展开世界:在强化空间推理中因子化4D属性

Hugging Face Daily Papers ↗ · 2026-09-03

本文介绍了FactoSR,一个因子化强化学习框架,通过将4D属性分解为正交子目标,增强了视觉-语言模型的空间推理能力,在多视角和视频基准测试中取得了显著的性能提升。

0 人收藏 0 人点赞
#spatial-reasoning

自回归马赛克:探测纯文本语言模型中的二维空间推理

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

介绍自回归马赛克(AM-Bench),一个用于评估纯文本大型语言模型是否具有真正的二维空间推理能力的基准,区别于代码生成。研究发现空间推理因模型而异,并受输出媒介如SVG与代码的影响。

0 人收藏 0 人点赞
#spatial-reasoning

UrbanGround:从局部感知到空间能动性在真实城市中的研究

Hugging Face Daily Papers ↗ · 2026-08-27 缓存

UrbanGround评估了多模态语言模型代理是否能在逼真的3D城市复制品中保持可靠的导航和空间推理能力,发现局部感知技能无法组合成扩展的目标导向行为。

0 人收藏 0 人点赞
#spatial-reasoning

AI 模型在这些智力测试中频频失手,你能做得更好吗?

MIT Technology Review ↗ · 2026-08-26 缓存

本文探讨了AI模型在空间推理和记忆谜题等智力测试中的表现不佳,突出了与人类认知的差距,并邀请读者测试自己的能力。

0 人收藏 0 人点赞
#spatial-reasoning

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

arXiv cs.CL ↗ · 2026-08-25 缓存

本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈