标签
本文通过因果干预审计多模态大语言模型中的视觉工具使用,揭示尽管总体准确率有所提升,返回的观察结果往往缺乏因果效应。它识别出诸如“不看就调用”和“不做规划就看”等失败模式,并引入了“视觉工具使用的幻觉”这一概念。
本文提出了一种因果审计方法,用于评估LLM智能体之间的潜在通信通道是否真正传递了与任务相关的信息,并将性能影响分解为消息存在性、内容以及特定智能体的贡献。应用于Qwen3模型后,结果表明仅凭总体准确率无法识别潜在消息的因果作用。