GeoArbiter:遥感多模态大语言模型的可验证性引导接地
摘要
GeoArbiter 提出了一种免训练流程,选择性地将图像无法验证的地理事实注入遥感多模态大语言模型,以减少知识幻觉,同时保留检索准确率的提升。
arXiv:2608.00877v1 公告类型:new
摘要:遥感多模态大语言模型(MLLMs)经常断言图像无法确定的事实,例如设施的身份或功能。基于坐标的地理检索可以补充这些缺失的知识,在三个开放MLLM上将fMoW土地利用准确率提升12.06--17.19个百分点。然而,检索到的记录也可能与可见证据相矛盾,我们发现即使在图像具有决定性的情况下,模型也经常遵循记录。我们认为,来源可信度因此应取决于\emph{跨模态可验证性}:地理记录对于图像无法验证的属性最有用,而在质疑视觉可验证属性时则最危险。我们提出了GeoArbiter,一个免训练流程,通过仅注入图像无法验证的地理事实来实现这一原则。与会在属性类型之间泄漏并使是/否响应产生偏差的仲裁提示不同,内容级过滤保留了完整检索准确率提升的84.69--87.15\%,在源盲评估器下将声明级幻觉降低了9.58--26.34\%,并提高了所有三个模型对冲突记录的鲁棒性。这些结果将可验证性引导的内容选择确定为一种简单有效的机制,用于将遥感MLLM锚定在可能出错的地理知识中。
查看缓存全文
缓存时间: 2026/08/04 07:43
# GeoArbiter:面向遥感多模态大语言模型的可验证性引导接地 来源:https://arxiv.org/html/2608.00877 ###### 摘要 遥感多模态大语言模型(MLLMs)常常断言图像本身无法确立的事实,例如设施的身份或功能。基于坐标键控的地理检索可以补足这类缺失知识,在三个开源 MLLM 上将 fMoW 土地利用准确率提升 12.06–17.19 个百分点。然而,检索到的记录也可能与可见证据相矛盾,我们发现即使图像具有决定性,模型也常常会遵从记录。因此我们认为,来源可信度应取决于**跨模态可验证性**:对于图像无法验证的属性,地理记录最为有用;而当它们与视觉上可验证的属性相悖时则最为危险。我们提出 GeoArbiter,一条无需训练(training-free)的流水线,通过只注入图像不可验证的地理事实来实现这一原则。与会在属性类型间泄漏并偏置是/否回答的仲裁提示(arbitration prompts)不同,内容级过滤保留了完整检索准确率增益的 84.69–87.15%,在来源盲评(source-blinded judge)下将声明级幻觉降低 9.58–26.34%,并在全部三个模型上提升了对冲突记录的鲁棒性。这些结果表明
相似文章
面向地理空间数据检索的风险感知LLM代理:设计与初步对抗性评估
介绍了一种基于LLM的框架,通过自然语言查询从基于云的地理空间目录中检索遥感数据,重点关注安全性和对抗鲁棒性。该系统集成了三个代理,用于意图解释、API调用生成和风险管理。
缓解流形偏离:面向可信MLLM解码的不确定性感知子空间矫正
本文介绍了MGAP,一种无需训练的解码方法,通过自适应地仅抑制语言先验中的有害部分,同时保留模型的语义流形,从而减少多模态大语言模型中的幻觉。该方法在POPE和CHAIR基准测试上优于先前的基线方法。
信任但验证:通过事后对抗性审计和多智能体反馈循环减轻医疗幻觉
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。
GeoStack:一种用于VLMs中拟阿贝尔知识组合的框架
GeoStack 引入了一种几何框架,用于在视觉语言模型中组合独立训练的领域专家,而不会出现灾难性遗忘,实现了常数时间推理,并将几何误差降低了10倍。
RemoteZero:实现零人工标注的地理空间推理
RemoteZero 是一个框架,通过利用多模态大语言模型(MLLMs)的语义验证能力,消除了地理空间推理中对人工标注框监督的需求,从而实现了从未经标注的遥感数据中进行自我演进的定位能力。