visual-language-models

标签

Cards List
#visual-language-models

当思考带来伤害:视觉语言模型推理链中的认知信号

arXiv cs.LG ↗ · 2026-07-10 缓存

本文对思考模式下的视觉语言模型的不确定性进行了实证分析,表明思考链熵比传统的答案令牌分布(在这种模型中会失效)是更可靠的幻觉检测信号。

0 人收藏 0 人点赞
#visual-language-models

识别与解决知识型VQA基准测试的陷阱:审计、修复与增强

arXiv cs.CL ↗ · 2026-07-02 缓存

本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。

0 人收藏 0 人点赞
#visual-language-models

工业场景中的零样本学习:新的大规模基准、挑战与基线

arXiv cs.AI ↗ · 2026-06-09 缓存

本文提出了一个用于零样本工业缺陷检测的大规模多模态数据集(MMIO),并介绍了改进文本-视觉提示(RTVP)方法,在该基准上取得了最优结果。

0 人收藏 0 人点赞
#visual-language-models

从数据到洞察:探索程序思维提示在图表摘要中的应用

arXiv cs.CL ↗ · 2026-05-29 缓存

本文介绍了一种基于程序思维提示(Program-of-Thoughts prompting)的零样本图表摘要策略,其中轻量级视觉语言模型(VLMs)生成Python程序来计算统计数据,从而在事实准确性上优于现有方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈