PhotoFlow:自主式3D虚拟摄影任务

Hugging Face Daily Papers 论文

摘要

介绍PhotoFlow,一个由导演(Director)、评审(Reviewer)和反思(Reflector)模块组成的智能体,用于语言条件虚拟摄影,可在任意Blender场景中运行,并附带VPhotoBench基准。该系统结合3D空间理解与审美判断,从文本意图生成照片。

虚拟摄影要求智能体进入一个预制的3D场景,没有预设相机姿态或参考图像,从场景信息和语言意图中推断合适的镜头,选择可执行的相机参数,并渲染最终照片。视觉语言模型的最新进展使这类空间智能体越来越可行,但该任务强调了两个难以同时评估的能力:复杂3D空间理解与抽象审美判断。我们提出了PhotoFlow,一种用于闭环相机搜索的导演-评审-反思智能体。导演构建软摄影蓝图并提出多样化的候选相机;评审结合规则检查、视觉批评和成对现任选择;反思将失败转化为区域记忆、死区抑制和高探索重定位。我们还引入了VPhotoBench,一个包含47个开源Blender场景和141个语言条件摄影任务(涵盖主体放置、关系构图、氛围/风格)的基准。在保留实验中,PhotoFlow在使用六轮渲染预算的一次性预测、单链反思、锚库选择和随机搜索中,获得了最强的外部质量对齐复合指标和成功率。据我们所知,这是首个将任意Blender场景中的语言条件虚拟摄影作为可执行智能体任务的工作,我们的结果表明,在以LLM为中心的空间智能体设置中,面对同时挑战3D推理和审美选择的任务,其已经可以生成高质量的照片。
查看原文
查看缓存全文

缓存时间: 2026/05/25 06:36

论文页面 - PhotoFlow:自主式3D虚拟摄影任务

来源:https://huggingface.co/papers/2605.23771

摘要

一个名为PhotoFlow的导演-评审-反思(Director-Reviewer-Reflector)智能体,通过将3D空间理解与审美判断相结合,在任意Blender场景中实现语言条件下的虚拟摄影。

虚拟摄影要求智能体进入一个准备好的3D场景,没有预设的相机姿态或参考图像,根据场景信息和语言意图推断出合适的镜头,选择可执行的相机参数(https://huggingface.co/papers?q=camera%20parameters),并渲染最终照片。近年来视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)的进展使得这种空间智能体(https://huggingface.co/papers?q=spatial%20agent)越来越可行,但该任务对两种能力提出了挑战,而这两种能力很难一起评估:复杂的3D空间理解(https://huggingface.co/papers?q=3D%20spatial%20understanding)和抽象的审美判断(https://huggingface.co/papers?q=aesthetic%20judgment)。我们提出了PhotoFlow(https://huggingface.co/papers?q=PhotoFlow),一种用于闭环相机搜索的导演-评审-反思智能体(https://huggingface.co/papers?q=Director-Reviewer-Reflector%20agent)。导演构建一个软性摄影蓝图(https://huggingface.co/papers?q=photographic%20blueprint)并提出多样化的候选相机;评审结合规则检查、视觉批评(https://huggingface.co/papers?q=visual%20critique)和配对最优选择;反思将失败转化为区域记忆(https://huggingface.co/papers?q=region%20memory)、死区抑制(https://huggingface.co/papers?q=dead-zone%20suppression)和高度探索性重定位(https://huggingface.co/papers?q=high-explore%20relocation)。我们还提出了VPhotoBench(https://huggingface.co/papers?q=VPhotoBench),一个包含47个开放许可Blender场景(https://huggingface.co/papers?q=Blender%20scenes)和141个语言条件摄影(https://huggingface.co/papers?q=language-conditioned%20photography)任务的基准测试,涵盖主体放置、关系构图和氛围/风格。在留出实验中,PhotoFlow(https://huggingface.co/papers?q=PhotoFlow)在六轮渲染预算下,在一次性预测、单链反思、锚点库选择和随机搜索中取得了最强的外部质量-对齐组合和成功率。据我们所知,这是首个将任意Blender场景(https://huggingface.co/papers?q=Blender%20scenes)中的语言条件虚拟摄影变为可执行智能体任务的工作,我们的结果表明,一个以LLM为中心的空间智能体(https://huggingface.co/papers?q=LLM-centered%20spatial%20agent)已经能够在旨在挑战3D推理和审美选择的设置中生成高质量的照片。

查看arXiv页面(https://arxiv.org/abs/2605.23771) 查看PDF(https://arxiv.org/pdf/2605.23771) 项目页面(https://visionary-laboratory.github.io/PhotoFlow/) GitHub2(https://github.com/Visionary-Laboratory/PhotoFlow) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.23771)

在您的智能体中获取本论文:

hf papers read 2605\.23771

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

没有模型链接本论文

请在模型README.md中引用arxiv.org/abs/2605.23771,以便从此页面链接。

引用本论文的数据集0

没有数据集链接本论文

请在数据集README.md中引用arxiv.org/abs/2605.23771,以便从此页面链接。

引用本论文的Space0

没有Space链接本论文

请在Space README.md中引用arxiv.org/abs/2605.23771,以便从此页面链接。

包含本论文的收藏0

没有收藏包含本论文

请将本论文添加到一个收藏(https://huggingface.co/new-collection)中以从此页面链接。

相似文章

PixWorld:在像素空间中统一3D场景生成与重建

Hugging Face Daily Papers

PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。