PhotoFlow:自主式3D虚拟摄影任务
摘要
介绍PhotoFlow,一个由导演(Director)、评审(Reviewer)和反思(Reflector)模块组成的智能体,用于语言条件虚拟摄影,可在任意Blender场景中运行,并附带VPhotoBench基准。该系统结合3D空间理解与审美判断,从文本意图生成照片。
查看缓存全文
缓存时间: 2026/05/25 06:36
论文页面 - PhotoFlow:自主式3D虚拟摄影任务
来源:https://huggingface.co/papers/2605.23771
摘要
一个名为PhotoFlow的导演-评审-反思(Director-Reviewer-Reflector)智能体,通过将3D空间理解与审美判断相结合,在任意Blender场景中实现语言条件下的虚拟摄影。
虚拟摄影要求智能体进入一个准备好的3D场景,没有预设的相机姿态或参考图像,根据场景信息和语言意图推断出合适的镜头,选择可执行的相机参数(https://huggingface.co/papers?q=camera%20parameters),并渲染最终照片。近年来视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)的进展使得这种空间智能体(https://huggingface.co/papers?q=spatial%20agent)越来越可行,但该任务对两种能力提出了挑战,而这两种能力很难一起评估:复杂的3D空间理解(https://huggingface.co/papers?q=3D%20spatial%20understanding)和抽象的审美判断(https://huggingface.co/papers?q=aesthetic%20judgment)。我们提出了PhotoFlow(https://huggingface.co/papers?q=PhotoFlow),一种用于闭环相机搜索的导演-评审-反思智能体(https://huggingface.co/papers?q=Director-Reviewer-Reflector%20agent)。导演构建一个软性摄影蓝图(https://huggingface.co/papers?q=photographic%20blueprint)并提出多样化的候选相机;评审结合规则检查、视觉批评(https://huggingface.co/papers?q=visual%20critique)和配对最优选择;反思将失败转化为区域记忆(https://huggingface.co/papers?q=region%20memory)、死区抑制(https://huggingface.co/papers?q=dead-zone%20suppression)和高度探索性重定位(https://huggingface.co/papers?q=high-explore%20relocation)。我们还提出了VPhotoBench(https://huggingface.co/papers?q=VPhotoBench),一个包含47个开放许可Blender场景(https://huggingface.co/papers?q=Blender%20scenes)和141个语言条件摄影(https://huggingface.co/papers?q=language-conditioned%20photography)任务的基准测试,涵盖主体放置、关系构图和氛围/风格。在留出实验中,PhotoFlow(https://huggingface.co/papers?q=PhotoFlow)在六轮渲染预算下,在一次性预测、单链反思、锚点库选择和随机搜索中取得了最强的外部质量-对齐组合和成功率。据我们所知,这是首个将任意Blender场景(https://huggingface.co/papers?q=Blender%20scenes)中的语言条件虚拟摄影变为可执行智能体任务的工作,我们的结果表明,一个以LLM为中心的空间智能体(https://huggingface.co/papers?q=LLM-centered%20spatial%20agent)已经能够在旨在挑战3D推理和审美选择的设置中生成高质量的照片。
查看arXiv页面(https://arxiv.org/abs/2605.23771) 查看PDF(https://arxiv.org/pdf/2605.23771) 项目页面(https://visionary-laboratory.github.io/PhotoFlow/) GitHub2(https://github.com/Visionary-Laboratory/PhotoFlow) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.23771)
在您的智能体中获取本论文:
hf papers read 2605\.23771
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型链接本论文
请在模型README.md中引用arxiv.org/abs/2605.23771,以便从此页面链接。
引用本论文的数据集0
没有数据集链接本论文
请在数据集README.md中引用arxiv.org/abs/2605.23771,以便从此页面链接。
引用本论文的Space0
没有Space链接本论文
请在Space README.md中引用arxiv.org/abs/2605.23771,以便从此页面链接。
包含本论文的收藏0
没有收藏包含本论文
请将本论文添加到一个收藏(https://huggingface.co/new-collection)中以从此页面链接。
相似文章
一个智能体如何通过串联两个Hugging Face空间构建3D巴黎画廊
一个智能体将两个Hugging Face空间(一个用于图像生成,一个用于3D重建)串联起来,生成了一个电影级3D巴黎画廊,展示了积木式经济模式——智能体将经过验证的组件拼接在一起,而非从头开始构建。
SmartPhotoCrafter:统一推理、生成与优化的自动摄影图像编辑
SmartPhotoCrafter 提出一条无需显式人工指令即可统一质量理解与增强的自动摄影图像编辑流水线,在真实感增强任务上超越现有生成模型。
SimWorlds:用于动态3D场景创作的多智能体系统
SimWorlds是一个多智能体框架,能够通过自然语言生成动态、可编辑的4D场景。它利用Blender特定的程序化知识以及规划-编码-审查工作流,性能优于先前基线。
使用MediaPipe读取面部表情并实时调整语音的开源智能体
Vision Agents 是一个开源Python框架,用于构建处理实时视频和音频的多模态AI智能体。它利用MediaPipe使对话智能体能够根据面部表情和目光方向调整语音。
PixWorld:在像素空间中统一3D场景生成与重建
PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。