perception-benchmarks

标签

Cards List
#perception-benchmarks

视觉工具使用的幻觉:对图像思考的因果审计

Hugging Face Daily Papers · 2026-08-06 缓存

本文通过因果干预审计多模态大语言模型中的视觉工具使用,揭示尽管总体准确率有所提升,返回的观察结果往往缺乏因果效应。它识别出诸如“不看就调用”和“不做规划就看”等失败模式,并引入了“视觉工具使用的幻觉”这一概念。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈