标签
本文介绍了Tri-PvP,这是一个基准测试,揭示了全模态大语言模型中的视觉偏差和非对称证据形式偏好,表明深层模态偏差可以从早期层线性解码,并且难以通过表面干预缓解。
介绍了C$^3$PO,一个包含3,404个样本的基准测试,用于评估多模态LLM中的跨模态组合与反事实推理。研究发现模态主导性导致了大多数失败,即使最佳模型(Gemini-3.1-Pro)也远低于人类准确率。