GeoArbiter:遥感多模态大语言模型的可验证性引导接地

arXiv cs.LG 论文

摘要

GeoArbiter 提出了一种免训练流程,选择性地将图像无法验证的地理事实注入遥感多模态大语言模型,以减少知识幻觉,同时保留检索准确率的提升。

arXiv:2608.00877v1 公告类型:new 摘要:遥感多模态大语言模型(MLLMs)经常断言图像无法确定的事实,例如设施的身份或功能。基于坐标的地理检索可以补充这些缺失的知识,在三个开放MLLM上将fMoW土地利用准确率提升12.06--17.19个百分点。然而,检索到的记录也可能与可见证据相矛盾,我们发现即使在图像具有决定性的情况下,模型也经常遵循记录。我们认为,来源可信度因此应取决于\emph{跨模态可验证性}:地理记录对于图像无法验证的属性最有用,而在质疑视觉可验证属性时则最危险。我们提出了GeoArbiter,一个免训练流程,通过仅注入图像无法验证的地理事实来实现这一原则。与会在属性类型之间泄漏并使是/否响应产生偏差的仲裁提示不同,内容级过滤保留了完整检索准确率提升的84.69--87.15\%,在源盲评估器下将声明级幻觉降低了9.58--26.34\%,并提高了所有三个模型对冲突记录的鲁棒性。这些结果将可验证性引导的内容选择确定为一种简单有效的机制,用于将遥感MLLM锚定在可能出错的地理知识中。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:43

# GeoArbiter:面向遥感多模态大语言模型的可验证性引导接地
来源:https://arxiv.org/html/2608.00877

###### 摘要

遥感多模态大语言模型(MLLMs)常常断言图像本身无法确立的事实,例如设施的身份或功能。基于坐标键控的地理检索可以补足这类缺失知识,在三个开源 MLLM 上将 fMoW 土地利用准确率提升 12.06–17.19 个百分点。然而,检索到的记录也可能与可见证据相矛盾,我们发现即使图像具有决定性,模型也常常会遵从记录。因此我们认为,来源可信度应取决于**跨模态可验证性**:对于图像无法验证的属性,地理记录最为有用;而当它们与视觉上可验证的属性相悖时则最为危险。我们提出 GeoArbiter,一条无需训练(training-free)的流水线,通过只注入图像不可验证的地理事实来实现这一原则。与会在属性类型间泄漏并偏置是/否回答的仲裁提示(arbitration prompts)不同,内容级过滤保留了完整检索准确率增益的 84.69–87.15%,在来源盲评(source-blinded judge)下将声明级幻觉降低 9.58–26.34%,并在全部三个模型上提升了对冲突记录的鲁棒性。这些结果表明

相似文章

RemoteZero:实现零人工标注的地理空间推理

Hugging Face Daily Papers

RemoteZero 是一个框架,通过利用多模态大语言模型(MLLMs)的语义验证能力,消除了地理空间推理中对人工标注框监督的需求,从而实现了从未经标注的遥感数据中进行自我演进的定位能力。