ShutterMuse:基于多模态大语言模型的拍摄实时摄影指导
摘要
研究人员提出了CaptureGuide-Bench,一个用于拍摄实时摄影指导的基准测试,以及ShutterMuse,一个统一的多模态大语言模型,经过训练可提供构图和姿势建议,展示了优于通用模型的性能。
查看缓存全文
缓存时间: 2026/06/25 09:10
论文页面 - ShutterMuse:基于多模态大语言模型的拍摄时刻摄影指导
来源:https://huggingface.co/papers/2606.25763
摘要
研究人员为摄影辅助构建了一个新的基准和数据集,并开发了一个统一的多模态模型,可在图像拍摄过程中提供构图指导和姿态建议。
真实世界摄影需要在拍摄时获得关于相机取景和拍摄对象姿态的指导。然而,现有的美学裁剪(https://huggingface.co/papers?q=aesthetic%20cropping)基准主要评估事后裁剪预测,而忽略了面向拍摄对象的建议,导致多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs)在拍摄时刻的指导能力尚未得到充分探索。为填补这一空白,我们推出了CaptureGuide-Bench基准,包含两个互补任务:摄影师侧的构图(https://huggingface.co/papers?q=photographer-side%20composition)决策与优化,以及拍摄对象侧的场景条件姿态推荐。我们的评估揭示了现有模型的局限性:通用型MLLMs能做出构图决策,但缺乏精确的优化定位能力;而专门的美学裁剪(https://huggingface.co/papers?q=aesthetic%20cropping)模型虽能有效定位裁剪区域,但仅限于优化任务,两者均无法提供可操作的姿态指导。为支持模型开发,我们进一步构建了CaptureGuide-Dataset数据集,包含13万个带有文本解释和结构化视觉标注(https://huggingface.co/papers?q=visual%20annotations)的样本,并开发了ShutterMuse,这是一个统一的多模态大语言模型,通过监督学习和强化微调(https://huggingface.co/papers?q=reinforcement%20fine-tuning)进行训练。在CaptureGuide-Bench上的实验表明,ShutterMuse在评估基线上实现了最佳的整体摄影师侧性能,同时以显著更低的推理成本提供有竞争力的拍摄对象侧姿态推荐(https://huggingface.co/papers?q=subject-side%20pose%20recommendation),展示了多模态大语言模型作为图像拍摄过程中交互式助手的潜力。
查看 arXiv 页面(https://arxiv.org/abs/2606.25763)查看 PDF(https://arxiv.org/pdf/2606.25763)项目页面(https://lijayutnt.github.io/ShutterMuse/)GitHub11(https://github.com/lijayuTnT/ShutterMuse)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.25763)
在您的代理中获取此论文:
hf papers read 2606.25763
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
ShutterMuse/ShutterMuse 图像文本到文本 • 9B • 更新于约 3 小时前(https://huggingface.co/ShutterMuse/ShutterMuse)
引用此论文的数据集1
ShutterMuse/CaptureGuide-Bench 更新于约 3 小时前 • 5(https://huggingface.co/datasets/ShutterMuse/CaptureGuide-Bench)
引用此论文的 Space1
包含此论文的收藏0
没有包含该论文的收藏
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。
Mind's Eye:面向多模态大模型的视觉抽象、变换与组合基准
研究者推出 Mind’s Eye,一项包含八道视觉认知任务的基准测试,显示顶级多模态大模型得分不足 50%,而人类可达 80%,暴露出视觉抽象、关系映射与心理变换方面的巨大差距。
TimeLens2: 通用视频时间定位与多模态大语言模型
TimeLens2 提出了一种使用多模态大语言模型的通用视频时间定位方法,将时间证据视为区间集,在多个基准上取得了最先进的性能。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准
研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。