放射学视觉语言模型基准的取证可重复性审计:从预期协议到发布产物
摘要
本文对放射学视觉语言模型基准进行了取证式可重复性审计,发现预期协议与发布产物之间存在差异,这些差异使原始声明失效。作者提出了一种基准合约,以暴露此类失败类别。
arXiv:2607.25589v1 公告类型:交叉
摘要:医学影像AI基准结合了数据集、DICOM渲染、提示词、提供商API、自动标签、统计代码、手稿和仓库发布。这些产物之间的一致性通常是假设的,而非经过测试。我们对一个保留的胸部X光片视觉语言模型(VLM)试点项目进行了回顾性取证可重复性审计;没有再次调用模型,也没有对任何图像或报告进行新标注。我们追踪了提示词绑定、DICOM元数据、输出完整性、标签提取、匹配分析和发布传播。在计划的300次模型-提示词调用中,297次产生了非空报告。标记为A/B的60次Claude调用使用了相同的C提示词执行。30项研究代表28名患者。四张MONOCHROME1图像在未进行所需极性反转的情况下渲染,数据集划分成员关系未保留,未经验证的提取器将五份报告截断为4000个字符。重建一个包含369个完整病例发现块的共同队列使Cochran's Q从154.73变为182.29。在45项McNemar比较中,27项未调整p<0.05,20项在Holm调整后仍低于0.05。这些数值仅描述了存档的自动标签矩阵;它们不能恢复预期的提示词比较,也不能确定临床性能。我们撤回原始的性能、排名、提示词效应和临床声明,并指定了针对队列、DICOM渲染、提示词和模型身份、调用状态、标注来源、键控分析和派生产物的机器可验证控制措施。
查看缓存全文
缓存时间: 2026/07/31 04:01
# 放射学视觉-语言模型基准的取证可重现性审计:从预期协议到已发布工件
Mateusz Kozłowski
https://orcid.org/0009-0005-7785-1342
独立研究者,波兰克拉科夫
###### 摘要
背景:医学影像AI基准通常以手稿、分析表格、可执行代码、提供商API和仓库发布等形式呈现。这些工件之间的一致性往往被假定存在,但很少被直接检验。
目的:确定一个已归档的胸部X光片视觉-语言模型(VLM)试点在何处偏离了其报告方案,这些偏离如何影响其主张的可识别性,以及哪些机器可验证的控制措施本可以发现这些偏离。
材料与方法:这是对现有本地项目快照及其公共仓库记录的取证审计。未再次调用任何模型,也未对报告或图像进行新的标注。我们追踪了已执行的提示绑定,清点了DICOM头信息和患者别名,核对计划输出与非空输出,检查了自动标签提取路径,通过显式的\(\mathrm{case},\mathrm{finding}\)键重新计算了配对检验,并扫描了手稿、图表、提交材料和仓库工件以查找传播失败。审计单位是工件或科学主张,而非患者结局。
结果:名义设计包含300次模型-提示调用;297次产生了非空报告。标注为A/B的60次Claude调用实际使用了相同的C提示执行。30项研究涉及28名患者,包括14张PA、11张AP、1张侧位和4张未记录投照体位;所有4张未记录投照体位的图像都是MONOCHROME1,并且未经所需的极性反转就进行了渲染。数据集划分未被保留。自动提取器未经验证;对于5份报告,它只接收了前4000个字符。将按位置截断替换为一个包含369个完整case-finding块的共同队列后,历史Cochran统计量从Q=154.73变为182.29。名义未调整p<0.05的McNemar比较数从26/45变为27/45;经Holm校正后,该数量从18/45变为20/45。这些算术修正并未恢复预期的提示估计目标。在手稿更正后,过时的模型名称和结果仍保留在已发布的仓库包中。
结论:修正后的表格在数值上可重现,但其条件与所报告的实验不同。原始的性能和提示效应主张被撤回,该旧基准对于结局推断无效。一个绑定队列成员资格、渲染图像和提示哈希、提供商解析的模型身份、调用状态、标注来源、键控分析和派生工件检查的基准合约被设计用于暴露这些失败类别。该发布仅以合成夹具实现了选定的防护措施;完整合约尚未经过前瞻性验证。
关键词:医学影像人工智能;视觉-语言模型;放射学;基准完整性;可相似文章
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。
VLMs 是阅读还是改写?关于视觉语言模型转录忠实性的研究
本文揭示了视觉语言模型在面对错别字或视觉伪影等扰动时,往往会改写文本而非忠实转录,并引入了 FaithC4 基准来评估多种模型和语言中的这种行为。
基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式
本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。
审计审计:基准有效性审计的五大失效模式
本文识别了基于扰动的基准有效性审计中的五种失效模式,这些审计常用于AI治理。研究表明,实现细节可以悄无声息地制造结论。本文提出了一种尽职调查关口,以提高评估证据的可靠性。
压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。