标签
本文提出了一种 LLM 驱动的智能体架构,将向量量化的测地线轨迹转化为可复用的工具,使快速的非推理模型能够达到链式思维(chain-of-thought)的性能,同时将决策延迟从分钟级降低到秒级。
本文提出 Soft Spatial Reasoning,一个针对大型视觉-语言模型(LVLM)空间任务的后训练框架,其引入自适应的"软思考"机制:在中间推理步骤中混合 token 嵌入,而非直接选定某个离散 token。AdaptSoft 控制器会根据隐藏状态与预测不确定性动态调整软化程度,在多个空间推理基准上超越了硬思考(hard)与固定软化程度的 CoT 基线。
SpatialCORE 是一个后训练框架,将模型对其生成的边界框接地的置信度用作大型视觉-语言模型进行空间推理的学习信号,在空间推理基准测试中取得了开源模型中的最先进结果。
LeRF 引入了一种方法,通过学习参考坐标系来增强视觉语言模型中的视角转换推理,通过监督微调和强化学习提高了在基准测试上的性能。
SpatialSpeak 引入了一个两阶段框架,用于视觉语言模型中的空间推理,使用问答原生重建预训练和空间链式思考学习,以在基准测试中实现最先进的性能。
Epoch AI 创建了家具组装基准(FAB),用于测试 AI 模型在 IKEA 组装照片中识别错误的视觉推理能力。OpenAI 的 GPT-6 Astra 以 80% 的准确率领先,显示出比以往模型的大幅改进。
Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。
HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。
Astra 在 Blueprint-Bench 2 上获得最高分,这是一个测试 AI 智能体使用空间推理和跨公寓学习将公寓照片转换为精确 2D 平面图能力的基准测试。
Astra 在 MazeBench 上取得了最先进的性能,在3D开放世界空间推理评估中显著超越了 GPT-6。
作者讨论了 GPT-6 Astra 在演示中展示的先进迭代式 3D 建模能力,包括对几何结构进行推理并逐步优化结果,并想知道是哪些技术变革推动了这一飞跃。
据称,Astra 在空间与 3D 理解方面超越了其他主流模型,在 VoxelBench 基准测试中排名第一,Elo 评分超过 2600 分,领先优势达 300 分以上。
ZDTaichu5.0-9B 是一个多模态基础模型,结合了 Qwen3.5-9B 语言骨架和 C-RADIOv4-H 视觉编码器,在10B规模的视觉语言模型中擅长一般视觉理解、空间推理和代理任务。
本文介绍了RoboSPA,这是一个用于评估视觉-语言-动作模型在机器人操作中细粒度空间推理和长期过程规划能力的大规模基准测试。
Playco 使用 GPT-6 Astra 构建了 Playbot,这是一个面向游戏开发者的AI驱动IDE,将手动修复减少了50%,并提升了空间推理和原型制作效率。
本文介绍了FactoSR,一个因子化强化学习框架,通过将4D属性分解为正交子目标,增强了视觉-语言模型的空间推理能力,在多视角和视频基准测试中取得了显著的性能提升。
介绍自回归马赛克(AM-Bench),一个用于评估纯文本大型语言模型是否具有真正的二维空间推理能力的基准,区别于代码生成。研究发现空间推理因模型而异,并受输出媒介如SVG与代码的影响。
UrbanGround评估了多模态语言模型代理是否能在逼真的3D城市复制品中保持可靠的导航和空间推理能力,发现局部感知技能无法组合成扩展的目标导向行为。
本文探讨了AI模型在空间推理和记忆谜题等智力测试中的表现不佳,突出了与人类认知的差距,并邀请读者测试自己的能力。
本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。