标签
SpatialSpeak 引入了一个两阶段框架,用于视觉语言模型中的空间推理,使用问答原生重建预训练和空间链式思考学习,以在基准测试中实现最先进的性能。
Epoch AI 创建了家具组装基准(FAB),用于测试 AI 模型在 IKEA 组装照片中识别错误的视觉推理能力。OpenAI 的 GPT-6 Astra 以 80% 的准确率领先,显示出比以往模型的大幅改进。
Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。
HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。
Astra 在 Blueprint-Bench 2 上获得最高分,这是一个测试 AI 智能体使用空间推理和跨公寓学习将公寓照片转换为精确 2D 平面图能力的基准测试。
Astra 在 MazeBench 上取得了最先进的性能,在3D开放世界空间推理评估中显著超越了 GPT-6。
作者讨论了 GPT-6 Astra 在演示中展示的先进迭代式 3D 建模能力,包括对几何结构进行推理并逐步优化结果,并想知道是哪些技术变革推动了这一飞跃。
据称,Astra 在空间与 3D 理解方面超越了其他主流模型,在 VoxelBench 基准测试中排名第一,Elo 评分超过 2600 分,领先优势达 300 分以上。
ZDTaichu5.0-9B 是一个多模态基础模型,结合了 Qwen3.5-9B 语言骨架和 C-RADIOv4-H 视觉编码器,在10B规模的视觉语言模型中擅长一般视觉理解、空间推理和代理任务。
本文介绍了RoboSPA,这是一个用于评估视觉-语言-动作模型在机器人操作中细粒度空间推理和长期过程规划能力的大规模基准测试。
Playco 使用 GPT-6 Astra 构建了 Playbot,这是一个面向游戏开发者的AI驱动IDE,将手动修复减少了50%,并提升了空间推理和原型制作效率。
本文介绍了FactoSR,一个因子化强化学习框架,通过将4D属性分解为正交子目标,增强了视觉-语言模型的空间推理能力,在多视角和视频基准测试中取得了显著的性能提升。
介绍自回归马赛克(AM-Bench),一个用于评估纯文本大型语言模型是否具有真正的二维空间推理能力的基准,区别于代码生成。研究发现空间推理因模型而异,并受输出媒介如SVG与代码的影响。
UrbanGround评估了多模态语言模型代理是否能在逼真的3D城市复制品中保持可靠的导航和空间推理能力,发现局部感知技能无法组合成扩展的目标导向行为。
本文探讨了AI模型在空间推理和记忆谜题等智力测试中的表现不佳,突出了与人类认知的差距,并邀请读者测试自己的能力。
本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。
StateSight是一个用于评估视觉语言模型空间状态重建的新基准,显示像GPT-5.5和Claude Sonnet 5这样的模型在空间推理任务上与人类表现相比存在困难。
本文提出了一种模块化的医学成像代理,通过将任务分解为解析、定位和几何规则来验证CT扫描中的空间关系,实现了94.1%的准确率,并在基准测试中以42.5个百分点的优势超越了端到端视觉语言模型,同时确保了可审计的推理过程。
SPARGen引入了一个统一的多模态框架,将3D重建、稠密对应和空间推理视为指令条件生成任务,从而实现共享空间表示。
本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。