看向何处:基础模型能否通过主动探索达到目标视角?
摘要
介绍了 Target Viewpoint Reproduction (TVR) 任务和 TVRBench 基准,用于评估基础模型主动调整 3D 视角以匹配目标图像的能力。实验揭示了当前开源和闭源模型的显著局限性,统一的后训练框架将成功率从约12%提升至约51%。
查看缓存全文
缓存时间: 2026/06/02 15:38
论文页面 - 寻找目标视角:基础模型能否通过主动探索到达目标视野?
来源:https://huggingface.co/papers/2606.01247
摘要
目标视角重现任务挑战基础模型主动调整3D视角以匹配目标图像,揭示了视觉历史处理与具身运动映射的局限性,而统一的后训练框架通过多种训练方法提升了成功率。
人类可以通过主动的头部和身体运动重现目标图像指定的视角,然而基础模型中的空间智能(https://huggingface.co/papers?q=spatial%20intelligence)在很大程度上仍被研究为对预采集观测的被动理解。我们引入了目标视角重现(https://huggingface.co/papers?q=Target%20Viewpoint%20Reproduction)(TVR)——一项主动任务,智能体在3D环境中调整其视角,直到其观测与给定目标图像相匹配——以及 TVRBench(https://huggingface.co/papers?q=TVRBench),一个覆盖场景规模与目标视图视觉丰富度的室内模拟基准。TVR远未被解决:在评估集上,最强的开源和闭源模型仅达到7.8%和12.0%的成功率。细粒度分析识别出两个一致的瓶颈:现成模型在多轮视觉历史(https://huggingface.co/papers?q=visual%20history)上表现困难;当视角重现需要身体平移而非原地旋转时,性能急剧下降,暴露出将空间差异映射到具身运动的缺口。为了研究缩小这一差距,我们构建了一个统一的TVR后训练框架(https://huggingface.co/papers?q=post-training%20framework),涵盖专家轨迹SFT(https://huggingface.co/papers?q=expert-trajectory%20SFT)、推理监督的CoT-SFT(https://huggingface.co/papers?q=rationale-supervised%20CoT-SFT)、离线单轮GRPO(https://huggingface.co/papers?q=offline%20Single-turn%20GRPO)和基于实时模拟器交互的在策略多轮GRPO(https://huggingface.co/papers?q=on-policy%20Multi-turn%20GRPO)。视觉-动作SFT提供了主要增益,将9B开源模型的成功率提升至50.8%;多轮GRPO提供了针对性的多房间细化,达到51.4%的整体成功率,而CoT监督和单轮GRPO则降低了闭环性能。这些结果确立了TVRBench(https://huggingface.co/papers?q=TVRBench)作为测量和训练主动感知并在3D环境中行动的基础模型的测试平台。我们的代码、数据和模型可在 https://github.com/aim-uofa/TVRBench(https://huggingface.co/papers?q=TVRBench)获取。
查看 arXiv 页面(https://arxiv.org/abs/2606.01247)查看 PDF(https://arxiv.org/pdf/2606.01247) GitHub13(https://github.com/aim-uofa/TVRBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01247)
在您的智能体中获取此论文:
hf papers read 2606.01247
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型1
TVRBench/tvr-qwen3.5-9b-va-sft-rl 图像-文本到文本 • 9B• 约13小时前更新 • 33(https://huggingface.co/TVRBench/tvr-qwen3.5-9b-va-sft-rl)
引用本文的数据集2
TVRBench/tvr-sft-va-cot 查看器 • 约13小时前更新 • 1.6k • 2.72k(https://huggingface.co/datasets/TVRBench/tvr-sft-va-cot)
TVRBench/tvr-sft-va 查看器 • 约13小时前更新 • 1.6k • 2.68k(https://huggingface.co/datasets/TVRBench/tvr-sft-va)
引用本文的Space0
没有关联此论文的Space
在Space的README.md中引用arxiv.org/abs/2606.01247以从该页面链接。
包含本文的集合0
没有包含此论文的集合
将此论文添加到收藏(https://huggingface.co/new-collection)以从该页面链接。
相似文章
WildTableBench:在真实场景中评估多模态基础模型的表格理解能力
WildTableBench 提出了首个针对真实世界表格图像的问答应答基准,揭示了现有多模态基础模型在结构感知和数值推理方面存在显著困难,仅有1个模型准确率超过50%。
MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准
MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。
主动观察者的测试
本文介绍了ActiveVision,一个用于评估多模态大语言模型主动观察能力的基准测试。前沿模型如GPT-5.5和Claude Fable 5表现不佳,分别仅解决了10.6%和3.5%的任务,而人类达到了96.1%,凸显了迭代视觉感知的缺失。
SpatialBench: 你的空间基础模型是全能选手吗?
SpatialBench是一个综合基准,用于评估跨不同领域和任务的空间基础模型,揭示了当前模型的局限性,并引入了DA-Next-5M和DA-Next以推动空间表示学习。
同一场景,两种深度:探索单目基础模型中的几何模糊性
引入MultiDepth-3k基准,用于评估单目深度基础模型中的深度层偏好,并展示拉普拉斯视觉提示(Laplacian Visual Prompting)可以改变报告的深度层,表明不同模型之间存在互补的几何假设。