AquaAugmentor:一种新颖的特征增强算法,用于水质可饮用性预测
摘要
本文介绍了 AquaAugmentor,这是一种新颖的特征增强算法,旨在利用化学属性提升机器学习和深度学习模型在水质可饮用性分类中的预测性能。
arXiv:2607.15775v1 公告类型:新
摘要:获得可饮用水对于健康、经济发展和可持续发展至关重要。然而,由于水源数据的复杂性和多变性,准确分类水质仍然是一个重大挑战。本文通过机器学习和深度学习算法解决预测水质可饮用性的挑战。引入了一种新颖的特征增强算法 AquaAugmentor,以增强这些模型在低维数据集上的预测性能。利用一个包含水的化学属性(如pH值、硬度、固体物质、氯胺、硫酸盐等)的数据集。本研究评估了使用和不使用 AquaAugmentor 的模型性能。每个模型用于将水分类为可饮用或不可饮用,然后基于测试准确率和AUC分数评估和比较其性能。结果突出了我们提出的算法的优势和局限性,为改进水质分类预测性能的最有效技术提供了见解。本研究有助于确保安全饮用水的更广泛努力,并作为在环境质量评估中采用机器学习的框架。研究结果旨在帮助研究人员、政策制定者和公共卫生官员基于可靠的机器学习预测做出明智的决策。
查看缓存全文
缓存时间: 2026/07/20 09:31
# AquaAugmentor:一种用于饮用水可饮用性预测的新型特征增强算法
来源:https://arxiv.org/html/2607.15775
Muntasir Tabasum¹、Al Zadid Sultan Bin Habib²、Tanpia Tasnim³、Md. Ekramul Islam⁴、Md Younus Ahamed⁵、Md Asif Bin Syed⁶
###### 摘要
获得可饮用水对健康、经济发展和可持续性至关重要。然而,由于水源数据的复杂性和变异性,准确分类水质仍然是一项重大挑战。本文通过机器学习和深度学习算法解决饮用水可饮用性预测的难题,并引入一种新颖的特征增强算法——AquaAugmentor,以提升这些模型在低维数据集上的预测性能。利用包含水化学属性(如pH值、硬度、固体物、氯胺、硫酸盐等)的数据集,本研究评估了有无AquaAugmentor时模型的性能。每个模型被用于将水分类为可饮用或不可饮用,并基于测试准确率和AUC分数对其性能进行评估与比较。结果凸显了我们所提出算法的优势与局限性,为提升水质分类预测性能的最有效技术提供了见解。本研究有助于确保安全饮用水获取的更广泛努力,并为在环境质量评估中应用机器学习提供了框架。研究结果旨在帮助研究人员、政策制定者和公共卫生官员根据可靠的机器学习预测做出明智决策。
## I. 引言
获得清洁安全的饮用水是一项基本人权,但在全球范围内仍是一项重大挑战。世界卫生组织(WHO)报告称,超过20亿人生活在水资源紧张的国家,其中安全用水的获取要么有限,要么完全不可用[¹⁸](https://arxiv.org/html/2607.15775#bib.bib14)。高效的水质检测与验证对公共卫生和环境可持续性至关重要。然而,传统的水质检测方法可能耗时费力,通常需要专业设备和训练有素的人员。因此,人们越来越关注利用先进技术来简化和提高水质检测的准确性。正在探索创新解决方案,如实时监测系统、生物传感器和机器学习算法,以提供快速、精确的饮用水可饮用性评估。这些进步有可能大大降低受污染水带来的风险,为更多人确保更安全的饮用水,并支持全球实现联合国可持续发展目标(SDGs)中与清洁水和卫生相关的目标[¹²](https://arxiv.org/html/2607.15775#bib.bib17),[¹¹](https://arxiv.org/html/2607.15775#bib.bib18)。机器学习通过基于化学和物理参数实现快速、经济且准确的饮用水可饮用性分类,为这些挑战提供了有前景的解决方案。近期研究已证明各种机器学习算法在环境监测和公共卫生应用(包括水质评估)中的潜力[⁵](https://arxiv.org/html/2607.15775#bib.bib15),[⁹](https://arxiv.org/html/2607.15775#bib.bib16)。例如,支持向量机(SVM)和神经网络因其在复杂环境数据场景中的预测准确性而备受关注[⁵](https://arxiv.org/html/2607.15775#bib.bib15)。这些模型可以处理大规模数据集,以识别传统方法可能遗漏的模式和相关性,提供更可靠的水质预测。此外,机器学习模型可以随着新数据不断更新和改进,确保它们在环境条件和污染源变化时保持有效性。将机器学习与传感器网络和实时数据收集相结合,可以开发响应更灵敏、适应性更强的水质监测系统。这些进步对加强公共卫生保护、减少水传播疾病发病率以及支持水资源的可持续管理具有巨大潜力[²⁰](https://arxiv.org/html/2607.15775#bib.bib19)。本研究探索并比较了各种机器学习和深度学习模型在将水分类为可饮用或不可饮用方面的有效性。每个模型的性能均通过测试准确率和AUC分数进行评估,以确定最适合实际应用的方法。我们的创新贡献——AquaAugmentor,一种特征增强算法,显著提升了这些模型的预测性能,尤其适用于低维数据集。这一进步凸显了集成先进计算技术以改善水质评估的潜力,有助于更广泛的环境科学工作,确保安全用水的获取。在本文中,第二节[II](https://arxiv.org/html/2607.15775#S2)重点介绍相关现有工作的文献综述。第三节[III](https://arxiv.org/html/2607.15775#S3)阐述方法框架。第四节[IV](https://arxiv.org/html/2607.15775#S4)讨论结果,第五节[V](https://arxiv.org/html/2607.15775#S5)总结全文并展望未来工作。
## II. 相关工作
获得可饮用水是一个影响健康、可持续性和经济发展的全球性问题。近期研究侧重于使用机器学习或深度学习评估和分类饮用水可饮用性,探索各种模型以根据化学和物理参数预测水质。Mukati等人探讨了随机森林、决策树和XGBoost等集成方法的有效性,强调这些方法相比传统统计技术能提供更高的预测准确性[¹³](https://arxiv.org/html/2607.15775#bib.bib1)。这与De Luna等人的研究结果一致,他们测试了AdaBoost、XGBoost和ExtraTree分类器,发现更复杂的集成模型有时能显著提高预测准确性,尤其是在处理非线性和复杂数据集结构方面[⁶](https://arxiv.org/html/2607.15775#bib.bib2)。Gao等人采用了二项逻辑回归和K近邻(KNN)算法,证明了它们对较小数据集的适用性,并强调了每个水质特征对可饮用性的独立影响的重要性[⁷](https://arxiv.org/html/2607.15775#bib.bib3)。SVM 因其在具有清晰边界分隔的数据集中的高准确性而特别受关注。Khanna等人引入了一种使用深度学习进行饮用水可饮用性分类的新方法,突出了其从水质参数复杂相互依赖中捕捉更深层见解的能力[¹⁰](https://arxiv.org/html/2607.15775#bib.bib4)。他们的研究结果表明,深度学习可以在预测准确性和可靠性方面带来重大进步。Yusuf等人证明了随机森林和决策树在实现更高分类准确性方面的有效性,强调了特征选择对模型性能的重要性[³](https://arxiv.org/html/2607.15775#bib.bib5)。深度学习模型,尤其是人工神经网络(ANN)和长短期记忆网络(LSTM),已被用于高精度预测水质,处理数据中复杂的非线性关系。Suleiman等人强调了这些模型在分类地下水可饮用性方面的卓越能力,反映了它们在环境科学中日益增长的应用[⁸](https://arxiv.org/html/2607.15775#bib.bib6)。正如Alipio所讨论的,将物联网(IoT)技术与机器学习模型集成,正在变革水质监测。这种方法利用实时数据采集和机器学习驱动的分析,以增强饮用水可饮用性评估的响应能力和准确性[¹⁶](https://arxiv.org/html/2607.15775#bib.bib7)。机器学习算法的比较研究揭示了不同技术之间的不同优势。Haq等人比较了几种机器学习算法,发现XGBoost和ExtraTree分类器等模型由于对多样化数据集的稳健处理而表现出优越性能[¹⁹](https://arxiv.org/html/2607.15775#bib.bib8)。Argreen等人[⁴](https://arxiv.org/html/2607.15775#bib.bib9)探索了深度学习模型在菲律宾农村地区饮用水可饮用性分类中的应用,强调了这些模型在增强水质监测方面的有效性。Ahmad Musleh[¹⁴](https://arxiv.org/html/2607.15775#bib.bib10)对六种机器学习算法进行了全面的比较研究,发现随机森林和J48在预测水质方面达到了最高的准确率和精确度。Alipio[²](https://arxiv.org/html/2607.15775#bib.bib11)开发了一个基于数据驱动的物联网系统,用于农村地区的实时水质监测和可饮用性分类。他将结果与常规实验室测试进行了匹配,证明了高准确率和最小的数据传输延迟。Patel等人[¹⁵](https://arxiv.org/html/2607.15775#bib.bib12)提出了一个基于机器学习的饮用水可饮用性预测模型,使用了合成少数类过采样技术(SMOTE)和可解释AI技术,实现了显著的准确性提升,并为水质评估的特征重要性提供了见解。Abuzir和Abuzir[¹](https://arxiv.org/html/2607.15775#bib.bib13)证明,多层感知器(MLP)在水质分类方面优于J48和朴素贝叶斯,强调了使用PCA进行特征选择和降维对于提高预测准确性的重要性。这些现有工作涵盖了广泛的最新研究,突出了机器学习在环境监测中应用的动态特性。集成先进计算技术,如深度学习和基于物联网的机器学习模型,值得关注,并为改善水质评估提供了有前景的途径。然而,这些方法通常依赖于特定数据集,并且在不同数据集之间差异显著。数据的维度可能不同,这对低维数据集获得高准确性构成了挑战。我们提出的AquaAugmentor算法通过利用特征增强的概念解决了这一挑战,为提升低维数据集的预测性能提供了一个稳健的解决方案。我们的工作通过AI驱动的预测推动了可持续水资源管理,这对工业5.0至关重要。
## III. 方法论
### III-A. 输入数据集
本研究所用的数据集[¹⁷](https://arxiv.org/html/2607.15775#bib.bib20)包含3276个样本,每个样本有九个水的化学属性:pH值、硬度、固体物、氯胺、硫酸盐、电导率、有机碳、三卤甲烷和浊度。这些特征对于确定水的可饮用性至关重要。数据集包括可饮用和不可饮用两类,其中1998个样本标记为不可饮用,1278个样本标记为可饮用。在进行预处理和分析之前,我们采用均值插补来处理缺失值,确保数据集完整可靠,以进行准确建模。
### III-B. 特征增强
特征增强是通过各种方法(包括多项式组合、统计汇总和领域特定计算)生成新特征来增强原始特征集的过程。
**多项式特征:** 通过将现有特征进行指定阶数的多项式组合来生成新特征。
**统计特征:** 添加汇总数据的特征,例如每个样本的均值、标准差、最小值和最大值。
**领域特定特征:** 基于领域知识创建新特征,例如现有特征之间的比率和其他关系。
通过结合这些方法,特征增强显著扩展了特征空间,可能提高模型捕捉数据中复杂模式的能力。在本研究中,我们应用特征增强来增强原始数据集。这包括生成多项式特征、添加统计汇总以及创建领域特定的比率。这种综合方法旨在为模型提供更丰富、信息量更大的特征集,从而提高其性能。
给定一个包含 \( n \) 个样本和 \( m \) 个特征的数据集 \( D \),其中最后一列是目标变量 \( y \):
\[
\mathbf{X} = D[:, :m] \tag{1}
\]
\[
\mathbf{y} = D[:, m] \tag{2}
\]
其中,\(\mathbf{X}\) 是形状为 \((n, m)\) 的特征矩阵,\(\mathbf{y}\) 是形状为 \((n,)\) 的目标向量。给定一个形状为 \((n, m)\) 的特征矩阵 \(\mathbf{X}\),多项式特征矩阵 \(\mathbf{X}_{\text{poly}}\) 包含特征直到指定阶数 \( d \) 的所有多项式组合:
\[
\mathbf{X}_{\text{poly}} = \text{Poly}(\mathbf{X}, d) \tag{3}
\]
其中 \(\text{Poly}(\mathbf{X}, d)\) 生成一个新矩阵,包含 \(\mathbf{X}\) 中特征直到阶数 \( d \) 的所有多项式组合,\(\mathbf{X}_{\text{poly}}\) 的形状取决于生成的多项式特征数量。
对于特征矩阵 \(\mathbf{X}\) 中的每个样本 \( i \),计算均值 \( \mu_i \)、标准差 \( \sigma_i \)、最小值 \( \min_i \) 和最大值 \( \max_i \):
\[
\mu_i = \frac{1}{m} \sum_{j=1}^{m} X_{ij} \tag{4}
\]
\[
\sigma_i = \sqrt{\frac{1}{m} \sum_{j=1}^{m} (X_{ij} - \mu_i)^2} \tag{5}
\]
\[
\min_i = \min_{j=1}^{m} X_{ij} \tag{6}
\]
\[
\max_i = \max_{j=1}^{m} X_{ij} \tag{7}
\]
其中 \( X_{ij} \) 是第 \( i \) 个样本的第 \( j \) 个特征的值,\( m \) 是特征数量。
为了基于领域知识通过计算原始特征的特定比率来创建新特征,我们可以假设 \(\mathbf{X}_{a,b}\) 表示 \(\mathbf{X}\) 中列 \( a \) 和 \( b \) 的元素级比率:
\[
\text{Feature}_k = \frac{X[:, a_k]}{X[:, b_k]} \tag{8}
\]
表[I](https://arxiv.org/html/2607.15775#S3.T1)显示了如何基于领域知识选择一组索引对 \((a_k, b_k)\)。
**表 I:领域特定特征的索引对。**
我们需要将原始多项式特征、统计特征和领域特定特征组合成一个组合特征矩阵 \(\mathbf{X}_{\text{comb}}\):
\[
\mathbf{X}_{\text{comb}} = \text{concat}(\mathbf{X}_{\text{poly}}, \mu, \sigma, \min, \max, \text{F}_1, \text{F}_2, \ldots, \text{F}_{14}) \tag{9}
\]
其中 \(\text{concat}\) 表示沿特征轴的拼接操作。\(\mathbf{X}_{\text{comb}}\) 是最终包含所有导出特征的扩展特征矩阵。\(\mathbf{X}_{\text{poly}}\) 代表多项式特征。\(\mu, \sigma, \min, \max\) 是统计特征(均值、标准差、最小值和最大值)。\(\text{F}_1, \text{F}_2, \ldots, \text{F}_{14}\) 代表根据上述描述的原始特征 \(a_k\) 和 \(b_k\) 比率生成的领域特定特征。相似文章
利用卫星衍生预测因子预测葡萄牙海岸的Pseudo-nitzschia有害藻华
本研究开发了一个机器学习框架,利用卫星衍生的环境和生物预测因子,预测葡萄牙海岸的Pseudo-nitzschia有害藻华,在现实约束条件下,使用Extra Trees模型达到了高达0.77的ROC-AUC。
连接化学家与人工智能:一种专家增强的可解释路线评估框架
本文介绍了一种专家增强的数据驱动评分框架,该框架将机器学习与化学家的领域知识相结合,用于评估多步合成路线,在预测准确性上相较于基线方法取得了显著提升。
利用深度学习在无几何参数条件下预测微流控装置中的惯性升力
本文提出了一种新颖的深度学习方法来预测微流控装置中的惯性升力,无需显式几何参数,与以前的模型相比,该方法能够更好地泛化到未见过的通道横截面。
PSK@EEUCA 2026:利用合成数据增强微调大型语言模型以检测游戏聊天中的多类毒性
本文介绍了一个用于 EEUCA 2026 游戏聊天毒性检测共享任务的系统,该系统通过结合合成数据增强微调 Llama 3.1 8B 模型,获得了第四名。文章重点阐述了一种“验证陷阱”现象:由于数据分布偏移,较高的验证分数与测试集表现并不相关。
利用时空图神经网络重建GRACE陆地水储量:南美洲应用
本文提出了一种深度学习的方法,使用时空图神经网络(MTGNN)重建南美洲自1940年以来的GRACE陆地水储量异常,实现了高精度,并且用更少的预测因子优于以往的方法。