ShutterMuse:基于多模态大语言模型的拍摄实时摄影指导

Hugging Face Daily Papers 论文

摘要

研究人员提出了CaptureGuide-Bench,一个用于拍摄实时摄影指导的基准测试,以及ShutterMuse,一个统一的多模态大语言模型,经过训练可提供构图和姿势建议,展示了优于通用模型的性能。

现实世界的摄影需要在拍摄时对相机取景和主体姿势进行指导。然而,现有的美学裁剪基准主要评估事后裁剪预测,忽略了主体侧的建议,导致多模态大语言模型(MLLMs)在拍摄指导方面的能力尚未被充分探索。为填补这一空白,我们提出了CaptureGuide-Bench,一个包含两个互补任务的基准测试:摄影师侧的构图决策与优化,以及被摄者侧的场景条件姿势建议。我们的评估揭示了局限性:通用MLLMs能够做出构图决策,但缺乏精确的优化定位;而专业的美学裁剪模型能有效定位裁剪,但仅限于优化;两者均无法提供可操作的姿势指导。为支持模型开发,我们进一步构建了CaptureGuide-Dataset,包含13万个样本,附有文本说明和结构化视觉标注,并开发了ShutterMuse,一个通过监督学习和强化微调训练的统一MLLM。在CaptureGuide-Bench上的实验表明,ShutterMuse在摄影师侧的整体表现优于所有评估基线,并在被摄者侧姿势建议中达到竞争性性能,同时推理成本显著降低,展示了MLLMs作为图像拍摄过程中交互式助手的潜力。
查看原文
查看缓存全文

缓存时间: 2026/06/25 09:10

论文页面 - ShutterMuse:基于多模态大语言模型的拍摄时刻摄影指导

来源:https://huggingface.co/papers/2606.25763

摘要

研究人员为摄影辅助构建了一个新的基准和数据集,并开发了一个统一的多模态模型,可在图像拍摄过程中提供构图指导和姿态建议。

真实世界摄影需要在拍摄时获得关于相机取景和拍摄对象姿态的指导。然而,现有的美学裁剪(https://huggingface.co/papers?q=aesthetic%20cropping)基准主要评估事后裁剪预测,而忽略了面向拍摄对象的建议,导致多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs)在拍摄时刻的指导能力尚未得到充分探索。为填补这一空白,我们推出了CaptureGuide-Bench基准,包含两个互补任务:摄影师侧的构图(https://huggingface.co/papers?q=photographer-side%20composition)决策与优化,以及拍摄对象侧的场景条件姿态推荐。我们的评估揭示了现有模型的局限性:通用型MLLMs能做出构图决策,但缺乏精确的优化定位能力;而专门的美学裁剪(https://huggingface.co/papers?q=aesthetic%20cropping)模型虽能有效定位裁剪区域,但仅限于优化任务,两者均无法提供可操作的姿态指导。为支持模型开发,我们进一步构建了CaptureGuide-Dataset数据集,包含13万个带有文本解释和结构化视觉标注(https://huggingface.co/papers?q=visual%20annotations)的样本,并开发了ShutterMuse,这是一个统一的多模态大语言模型,通过监督学习和强化微调(https://huggingface.co/papers?q=reinforcement%20fine-tuning)进行训练。在CaptureGuide-Bench上的实验表明,ShutterMuse在评估基线上实现了最佳的整体摄影师侧性能,同时以显著更低的推理成本提供有竞争力的拍摄对象侧姿态推荐(https://huggingface.co/papers?q=subject-side%20pose%20recommendation),展示了多模态大语言模型作为图像拍摄过程中交互式助手的潜力。

查看 arXiv 页面(https://arxiv.org/abs/2606.25763)查看 PDF(https://arxiv.org/pdf/2606.25763)项目页面(https://lijayutnt.github.io/ShutterMuse/)GitHub11(https://github.com/lijayuTnT/ShutterMuse)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.25763)

在您的代理中获取此论文:

hf papers read 2606.25763

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

ShutterMuse/ShutterMuse 图像文本到文本 • 9B • 更新于约 3 小时前(https://huggingface.co/ShutterMuse/ShutterMuse)

引用此论文的数据集1

ShutterMuse/CaptureGuide-Bench 更新于约 3 小时前 • 5(https://huggingface.co/datasets/ShutterMuse/CaptureGuide-Bench)

引用此论文的 Space1

包含此论文的收藏0

没有包含该论文的收藏

将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接它。

相似文章