VaseMuseum:古希腊陶器数字智能博物馆

Hugging Face Daily Papers 论文

摘要

本文提出VaseMuseum,一个轻量级多模态智能体框架,将3D数字化与视觉语言模型相结合,为古希腊陶器创建交互式数字博物馆,通过源级和响应级可靠性控制解决证据基础与幻觉问题。

视觉语言模型(VLM)通过将3D数字化与自然语言文物探索相结合,使交互式数字博物馆日益可行。然而,在古希腊陶器等文化遗产领域,可靠的VLM辅助受到两个挑战的限制。首先,开放式解读需要将细粒度的2D/3D视觉证据建立在专业策展知识基础上,但检索过程可能引入弱来源和不可验证的引用。其次,当可用证据不完整、有噪声或模糊时,VLM通常会产生自信但无支持的答案,而非校准的不确定性。为解决这些问题,我们提出VaseMuseum,一个面向古希腊陶器智能数字博物馆的轻量级模块化多模态智能体框架。VaseMuseum将交互式虚拟博物馆与VaseAgent相结合,后者通过多模态感知、3D感知推理、外部知识检索和推理时可靠性控制,支持2D图像和3D文物。具体来说,VaseAgent从权威网络和博物馆知识源检索证据,源级控制在生成前选择多样且可验证的证据。同时,响应级控制根据证据池检查生成的断言,并在支持不足或冲突时鼓励中立、有证据边界的答案。此外,一种无需训练的GRPO风格选择机制倾向于选择具有有效引用和校准置信度的响应,而无需更新VLM主干。在真实的数字博物馆模拟实验中,与支持搜索的VLM基线相比,VaseMuseum提高了引用有效性,减少了知识密集型查询上的幻觉,并在模糊情况下产生更中立的答案。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:49

Paper page - VaseMuseum: 古希腊陶器数字智能博物馆

来源:https://huggingface.co/papers/2607.06374

摘要

视觉语言模型(VLM)通过将3D数字化与自然语言文物探索相结合,使交互式数字博物馆日益可行。然而,在古希腊陶器等文化遗产领域,可靠的VLM辅助受到两个挑战的限制。首先,开放式解读需要将细粒度的2D/3D视觉证据锚定在专业策展知识中,但检索过程可能引入弱来源和不可验证的引用。其次,当可用证据不完整、有噪声或模糊时,VLM通常会给出自信但无依据的回答,而不是经过校准的不确定性。为应对这些挑战,我们提出VaseMuseum——一个轻量级、模块化的多模态智能体框架,用于古希腊陶器智能数字博物馆。VaseMuseum将交互式虚拟博物馆与VaseAgent相结合,后者通过多模态感知、3D感知推理、外部知识检索和推理时可靠性控制,同时支持2D图像和3D文物。具体而言,VaseAgent从权威网站和博物馆知识源检索证据,并在生成前通过源级控制选择多样且可验证的证据。同时,响应级控制根据证据池检查生成的声明,并在支持不足或存在冲突时鼓励中立、基于证据的回答。此外,一种无需训练的GRPO风格选择机制倾向于选择具有有效引用和校准置信度的响应,而无需更新VLM主干。在真实数字博物馆模拟中的实验表明,与启用搜索的VLM基线相比,VaseMuseum提高了引用有效性,减少了知识密集型查询上的幻觉,并在模糊情况下产生更中立的回答。

查看 arXiv 页面 (https://arxiv.org/abs/2607.06374)查看 PDF (https://arxiv.org/pdf/2607.06374)项目页面 (https://aigeeksgroup.github.io/VaseMuseum)GitHub1 (https://github.com/AIGeeksGroup/VaseMuseum)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.06374)

在您的智能体中获取此论文:

hf papers read 2607.06374

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.06374 以从该页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.06374 以从该页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.06374 以从该页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从该页面链接。

相似文章

MemEye:面向多模态智能体记忆的视觉中心评估框架

Hugging Face Daily Papers

MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。

面向多智能体 VLM 系统的协作记忆

arXiv cs.AI

本文提出了一种面向多智能体视觉语言模型系统的协作记忆框架,以解决分布式感知问题,并提升共享视觉上下文和推理一致性。

面向插花的四维数字档案设计

Hacker News Top

本文提出了一种四维数字观看系统,用于存档插花创作过程。该系统采用同步摄像头、眼动追踪和3D高斯泼溅(3D Gaussian Splatting)技术,支持从任意角度交互式观看。

SmartMage:面向3D场景理解的动态模态编排

Hugging Face Daily Papers

SmartMage 是一个统一的多模态大语言模型(LLM),它针对查询相关的3D场景理解动态编排视觉与几何模态,在五个基准上取得了最先进的结果。