@beingamanFF: 我们的系统论文被接受于 @emnlpmeeting @SHROOM_ST 2026,这是一个关于VLMs幻觉检测的共享任务,主持…

X AI KOLs Timeline 论文

摘要

一篇关于VLMs幻觉检测的系统论文已被EMNLP 2026接受,参与SHROOM共享任务,该任务在UncertaiNLP研讨会上举办,专注于标记和标注VLM输出中的幻觉字符跨度。

我们的系统论文被接受于 @emnlpmeeting @SHROOM_ST 2026,这是一个关于VLMs幻觉检测的共享任务,在UncertaiNLP研讨会上举办。 任务描述:给定一张图像、一个提示和一个VLM的答案(支持EN/FR/IT/ZH),标记每个幻觉字符跨度,给出概率,并标注其类型(发明、错误描述、OCR、错误计数、其他)。 讨论串 🧵 1/4
查看原文
查看缓存全文

缓存时间: 2026/09/12 10:51

我们的系统论文已被 @emnlpmeeting 的 @SHROOM_ST 2026 接收——这是一个在 UncertaiNLP 研讨会举办的视觉语言模型幻觉检测共享任务。

任务要求:给定图像、提示词以及 VLM 输出的英语/法语/意大利语/中文回答,标注所有幻觉字符片段,赋予其概率值,并分类标注(虚构、错误描述、OCR错误、计数错误、其他)。

系列推文 🧵 第1/4篇:

MycoGate-VL 系统概览图解:

采用 XLM-R 与多模态BERT(mmBERT)的字符回归器对文本字符进行排序 使用 LoRA 微调的 Qwen2.5-VL 判别头(基于黄金标注训练)从图像层面预测英语/法语/意大利语的幻觉类别。零样本 VLM 判定效果不佳,训练专用判别头效果显著 学习性清洁门控机制可对疑似干净文档进行弃权处理。我们测得的最大单项改进:中文相关性系数从 0.22 提升至 0.42,因为评分器会对干净文档的空预测给予完整置信度 序列化模块按照评分器的阅读顺序排列片段(详见下篇)

我最青睐的设计无需修改任何模型参数:评分器会根据你的片段列表,为每个字符重建概率值,同一字符被多个片段覆盖时,最后出现的片段决定最终概率。因此纯 argmax 列表实际上不会向评分器透露次优类别信息。解决方案是:先输出按类别组织的片段(得分×类别概率),最后输出 argmax 片段。相关性评估直接使用检测器原始分数;相关性+标签评估则对每个类别单独排序。

最终成果:

代码仓库(含评分器复现版、测试集、训练脚本及留出集重评分):https://github.com/beingamanforever/MycoGate-VL… 论文链接:https://openreview.net/forum?id=DcCzoyXJgi…

感谢 @SHROOM_ST 组委会及审稿人,你们的修改意见使终版论文更加清晰完善。布达佩斯见 <3

整个冬季将逐行攻克这些代码宝贝 @elliotarledge #sunghwanyun

深入并行编程技术及其在大语言模型中的应用实践

相似文章

LLM幻觉论文(使用数学方法)被ICML workshop接收[R]

Reddit r/MachineLearning

本文介绍了一种受子黎曼启发的SRM-LoRA方法,该方法利用基于敏感度的黎曼度量来降低低秩自适应过程中的LLM幻觉。该度量重新塑造了反向传播梯度,抑制了高成本的更新方向,从而在HaluEval-QA等基准测试上提高了事实可靠性。

从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉

arXiv cs.CL

本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

arXiv cs.CL

本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。