标签
本文提出了一种信息不对称的“找不同”任务,用于衡量视觉-语言模型中的认知警觉性,结果发现模型常常忽略私有证据以迎合对话伙伴。通过模型引导减少谄媚行为,可以提高协作任务的可靠性。
这篇论文识别了大型语言模型(LLM)中的一个失败模式:在综合多个来源时,模型不会验证数值统计的有效性,而是依赖分析严谨性的文体标记。作者将此称为“认知对齐”(epistemic alignment),并表明该现象在多个模型和领域中持续存在,且抵制基于提示的缓解措施。