噪声中的信号:面向生物医学文本分类的可审计可靠性层

arXiv cs.AI 论文

摘要

该论文提出了一种可审计的生物医学文本分类可靠性层,该层使用确定性拼写纠正来处理OCR伪影,通过在不确定时拒绝编辑来提升分类器性能并确保安全性。

arXiv:2608.28595v1 公告类型:新 摘要:生物医学自然语言处理流程通常预设输入文本是干净的,但通过自动化PDF解析构建的大规模语料库中存在普遍的类似OCR伪影、令牌分割与合并、连字符残留和字符级损坏,这些系统地侵蚀了词汇证据并降低了下游分类器性能。我们引入了一个保守的、完全可审计的拼写纠正可靠性层,它被设计为面向安全的预处理模块,而非最大化准确性的纠正器:在不确定条件下,系统会拒绝编辑,遵循医学不伤害原则。确定性架构将有界编辑距离候选生成与语料库派生的n-gram评分以及一套保护领域关键术语的生物医学安全门相结合。我们从内在和外在两个方面评估了该层:内在评估基于一个手工策划的包含2,104个令牌级案例的基准测试,外在评估基于一个三类CORD-19主题分类器(预防、治疗、流行病学),涵盖10,000个样本,并在有原则的四次运行协议(干净、噪声、恢复、安全)下进行。内在地,该层在合成错误上达到了94.61%的错误修复召回率,并在负对照中无有害编辑。下游地,它恢复了约80.45%的噪声引起的宏F1下降,将宏F1从0.7654(噪声)提升到0.7717(恢复),同时保持了接近干净的性能(安全:0.7721)。一项对103个真实世界OCR提取的摘要的补充案例研究,使用BioBERT进行分类,确认了Transformer编码器对轻度噪声相对鲁棒,这启发了一个未来的灰盒架构,该架构集成了有界神经信号和UMLS词库,同时不损害可审计性。该系统是完全确定性的、伪影驱动的,并在设计时考虑了部署和可审计性。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:26

# 噪音中的信号:面向生物医学文本分类的可审计可靠性层
来源:https://arxiv.org/abs/2608.28595
查看PDF (https://arxiv.org/pdf/2608.28595)

> 摘要:生物医学NLP流程通常默认输入文本干净,但通过自动化PDF解析构建的大规模语料库中普遍存在类似OCR的伪影、词符拆分与合并、连字符残留以及字符级损坏,这些系统性地削弱了词汇证据并降低了下游分类器性能。我们引入了一个保守的、完全可审计的拼写校正可靠性层,其设计定位为面向安全的预处理模块而非最大精度校正器:在不确定情况下,系统遵循医学上的“不伤害”原则,选择放弃编辑。其确定性架构结合了有界编辑距离候选生成与基于语料库的n-gram评分,以及一套保护领域关键术语的生物医学安全门控。我们对该层进行了内在评估(基于手工策划的2,104个词符级案例基准)和外在评估(基于10,000个示例的三类CORD-19主题分类器[预防、治疗、流行病学],并遵循严格的四轮协议[干净、噪声、恢复、安全])。内在评估中,该层在合成错误上达到94.61%的错误修正召回率,并在负面对照中实现零有害编辑。在下游任务中,它恢复了约80.45%的噪声诱导的宏观F1值下降,将宏观F1从0.7654(噪声)提升至0.7717(恢复),同时保持接近干净文本的性能(安全:0.7721)。一项针对103篇真实世界OCR提取摘要的补充案例研究表明,经BioBERT分类后,Transformer编码器对轻度噪声表现出相对较强的鲁棒性,这启发了未来研究一种集成有界神经信号与UMLS词典且不损害可审计性的灰盒架构。该系统完全确定性、由伪影驱动,并为部署和可审计性而设计。

## 提交历史

来自:Moustafa Yehia Hassan \[查看邮件 (https://arxiv.org/show-email/93b634fa/2608.28595)\] **\[v1\]** 2026年6月16日,星期二,23:14:36 UTC \(741 KB\)

相似文章

是什么来着?自动语音识别的认证鲁棒性

arXiv cs.LG

本文提出了一种基于认证的自动语音识别机制,采用双门诊断流水线(Two-Sided Atomic Audit 和 Rank-Based Tournament)来提供认证鲁棒性,并在多种架构上实现了词错误率高达55%的相对降低。

文本到SQL正确性的预测因素:一项选择性预测研究

arXiv cs.LG

本文研究了在选择性预测中哪些信号最能预测文本转SQL的正确性。研究发现,来自LLM判断器的基于验证的信号优于黑盒统计信号(如自一致性),并且双提供者集成模型实现了0.82的AUROC,同时具有良好校准的概率。

一种可迁移的基于阈值的可解释医学数据分类框架

arXiv cs.LG

本文介绍了一种基于统计的框架,使用伯努利朴素贝叶斯和χ²引导的二值化进行可解释的临床分类,在基准数据集上取得了有竞争力的AUC分数,同时提供了明确的决策规则和校准的风险估计。