看向何处:基础模型能否通过主动探索达到目标视角?

Hugging Face Daily Papers 论文

摘要

介绍了 Target Viewpoint Reproduction (TVR) 任务和 TVRBench 基准,用于评估基础模型主动调整 3D 视角以匹配目标图像的能力。实验揭示了当前开源和闭源模型的显著局限性,统一的后训练框架将成功率从约12%提升至约51%。

人类可以通过主动的头部和身体运动再现目标图像指定的视角,但基础模型的空间智能主要作为对预收集观测的被动理解来研究。我们引入了目标视角再现(Target Viewpoint Reproduction, TVR)——一个主动任务,其中智能体在3D环境中调整其视角,直到其观测与给定的目标图像匹配——以及TVRBench,一个室内模拟基准,涵盖场景尺度和目标视图视觉丰富度。TVR远未解决:在评估集上,最强的开源和闭源模型仅达到7.8%和12.0%的成功率。细粒度分析发现两个一致的瓶颈:现成模型难以处理多轮视觉历史,并且当视角再现需要身体平移而非原地旋转时,性能急剧下降,揭示了从空间差异到具身运动映射的差距。为了研究缩小这一差距,我们构建了一个统一的TVR后训练框架,包括专家轨迹SFT、理由监督的CoT-SFT、离线单轮GRPO和来自实时模拟器展开的在策略多轮GRPO。视觉-动作SFT提供了主要增益,将9B开源模型提升至50.8%的成功率;多轮GRPO提供了有针对性的多房间细化,总体达到51.4%,而CoT监督和单轮GRPO降低了闭环性能。这些结果确立了TVRBench作为衡量和训练主动感知和行动于3D环境的基础模型的试验场。我们的代码、数据和模型可在 https://github.com/aim-uofa/TVRBench 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:38

论文页面 - 寻找目标视角:基础模型能否通过主动探索到达目标视野?

来源:https://huggingface.co/papers/2606.01247

摘要

目标视角重现任务挑战基础模型主动调整3D视角以匹配目标图像,揭示了视觉历史处理与具身运动映射的局限性,而统一的后训练框架通过多种训练方法提升了成功率。

人类可以通过主动的头部和身体运动重现目标图像指定的视角,然而基础模型中的空间智能(https://huggingface.co/papers?q=spatial%20intelligence)在很大程度上仍被研究为对预采集观测的被动理解。我们引入了目标视角重现(https://huggingface.co/papers?q=Target%20Viewpoint%20Reproduction)(TVR)——一项主动任务,智能体在3D环境中调整其视角,直到其观测与给定目标图像相匹配——以及 TVRBench(https://huggingface.co/papers?q=TVRBench),一个覆盖场景规模与目标视图视觉丰富度的室内模拟基准。TVR远未被解决:在评估集上,最强的开源和闭源模型仅达到7.8%和12.0%的成功率。细粒度分析识别出两个一致的瓶颈:现成模型在多轮视觉历史(https://huggingface.co/papers?q=visual%20history)上表现困难;当视角重现需要身体平移而非原地旋转时,性能急剧下降,暴露出将空间差异映射到具身运动的缺口。为了研究缩小这一差距,我们构建了一个统一的TVR后训练框架(https://huggingface.co/papers?q=post-training%20framework),涵盖专家轨迹SFT(https://huggingface.co/papers?q=expert-trajectory%20SFT)、推理监督的CoT-SFT(https://huggingface.co/papers?q=rationale-supervised%20CoT-SFT)、离线单轮GRPO(https://huggingface.co/papers?q=offline%20Single-turn%20GRPO)和基于实时模拟器交互的在策略多轮GRPO(https://huggingface.co/papers?q=on-policy%20Multi-turn%20GRPO)。视觉-动作SFT提供了主要增益,将9B开源模型的成功率提升至50.8%;多轮GRPO提供了针对性的多房间细化,达到51.4%的整体成功率,而CoT监督和单轮GRPO则降低了闭环性能。这些结果确立了TVRBench(https://huggingface.co/papers?q=TVRBench)作为测量和训练主动感知并在3D环境中行动的基础模型的测试平台。我们的代码、数据和模型可在 https://github.com/aim-uofa/TVRBench(https://huggingface.co/papers?q=TVRBench)获取。

查看 arXiv 页面(https://arxiv.org/abs/2606.01247)查看 PDF(https://arxiv.org/pdf/2606.01247) GitHub13(https://github.com/aim-uofa/TVRBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01247)

在您的智能体中获取此论文:

hf papers read 2606.01247

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型1

TVRBench/tvr-qwen3.5-9b-va-sft-rl 图像-文本到文本 • 9B• 约13小时前更新 • 33(https://huggingface.co/TVRBench/tvr-qwen3.5-9b-va-sft-rl)

引用本文的数据集2

TVRBench/tvr-sft-va-cot 查看器 • 约13小时前更新 • 1.6k • 2.72k(https://huggingface.co/datasets/TVRBench/tvr-sft-va-cot)

TVRBench/tvr-sft-va 查看器 • 约13小时前更新 • 1.6k • 2.68k(https://huggingface.co/datasets/TVRBench/tvr-sft-va)

引用本文的Space0

没有关联此论文的Space

在Space的README.md中引用arxiv.org/abs/2606.01247以从该页面链接。

包含本文的集合0

没有包含此论文的集合

将此论文添加到收藏(https://huggingface.co/new-collection)以从该页面链接。

相似文章

主动观察者的测试

arXiv cs.CL

本文介绍了ActiveVision,一个用于评估多模态大语言模型主动观察能力的基准测试。前沿模型如GPT-5.5和Claude Fable 5表现不佳,分别仅解决了10.6%和3.5%的任务,而人类达到了96.1%,凸显了迭代视觉感知的缺失。