@beingamanFF: 我们的系统论文被接受于 @emnlpmeeting @SHROOM_ST 2026,这是一个关于VLMs幻觉检测的共享任务,主持…
摘要
一篇关于VLMs幻觉检测的系统论文已被EMNLP 2026接受,参与SHROOM共享任务,该任务在UncertaiNLP研讨会上举办,专注于标记和标注VLM输出中的幻觉字符跨度。
查看缓存全文
缓存时间: 2026/09/12 10:51
我们的系统论文已被 @emnlpmeeting 的 @SHROOM_ST 2026 接收——这是一个在 UncertaiNLP 研讨会举办的视觉语言模型幻觉检测共享任务。
任务要求:给定图像、提示词以及 VLM 输出的英语/法语/意大利语/中文回答,标注所有幻觉字符片段,赋予其概率值,并分类标注(虚构、错误描述、OCR错误、计数错误、其他)。
系列推文 🧵 第1/4篇:
MycoGate-VL 系统概览图解:
采用 XLM-R 与多模态BERT(mmBERT)的字符回归器对文本字符进行排序 使用 LoRA 微调的 Qwen2.5-VL 判别头(基于黄金标注训练)从图像层面预测英语/法语/意大利语的幻觉类别。零样本 VLM 判定效果不佳,训练专用判别头效果显著 学习性清洁门控机制可对疑似干净文档进行弃权处理。我们测得的最大单项改进:中文相关性系数从 0.22 提升至 0.42,因为评分器会对干净文档的空预测给予完整置信度 序列化模块按照评分器的阅读顺序排列片段(详见下篇)
我最青睐的设计无需修改任何模型参数:评分器会根据你的片段列表,为每个字符重建概率值,同一字符被多个片段覆盖时,最后出现的片段决定最终概率。因此纯 argmax 列表实际上不会向评分器透露次优类别信息。解决方案是:先输出按类别组织的片段(得分×类别概率),最后输出 argmax 片段。相关性评估直接使用检测器原始分数;相关性+标签评估则对每个类别单独排序。
最终成果:
代码仓库(含评分器复现版、测试集、训练脚本及留出集重评分):https://github.com/beingamanforever/MycoGate-VL… 论文链接:https://openreview.net/forum?id=DcCzoyXJgi…
感谢 @SHROOM_ST 组委会及审稿人,你们的修改意见使终版论文更加清晰完善。布达佩斯见 <3
整个冬季将逐行攻克这些代码宝贝 @elliotarledge #sunghwanyun
深入并行编程技术及其在大语言模型中的应用实践
相似文章
SpanCalib-VLM:视觉语言模型中的校准幻觉跨度检测
SpanCalib-VLM提出了一种混合系统,该系统结合了多模态序列标注器和生成式视觉语言模型,以增强幻觉跨度检测和校准,并在SHROOM-Visions任务中实现了性能提升。
LLM幻觉论文(使用数学方法)被ICML workshop接收[R]
本文介绍了一种受子黎曼启发的SRM-LoRA方法,该方法利用基于敏感度的黎曼度量来降低低秩自适应过程中的LLM幻觉。该度量重新塑造了反向传播梯度,抑制了高成本的更新方向,从而在HaluEval-QA等基准测试上提高了事实可靠性。
从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。
关注未见质量:通过软混合字母估计揭示 LLM 幻觉
研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。