基于决策树和K-Means的食用油拉曼光谱分析:一种物理信息AI方法
摘要
本研究建立了一个利用拉曼光谱和机器学习的物理信息AI框架来鉴定食用油,实现了高分类准确率和紧凑的光谱表示。
arXiv:2608.20440v1 Announce Type: new
摘要:加工食品中食用油的鉴定对于食品质量、欺诈预防和法规遵从非常重要。本研究建立了一个集成的拉曼光谱和机器学习框架,将固有的光谱组织、可解释分类和物理信息人工智能(PI-AI)联系起来。使用t-SNE、K-means聚类、决策树和基于非负最小二乘(NNLS)的光谱分解,研究了五种食用油在纯形式和炸薯片基质中的情况。无监督分析显示,纯油中的类别组织和可分离性明显更强,而食品基质效应引入了显著的光谱重叠。决策树仅使用原始1866特征光谱空间中的四个拉曼变量,就实现了纯油100%的分类准确率。这四个变量由预剪枝和后剪枝模型一致识别,仅占可用光谱信息的大约0.21%,同时保持了完美的测试集性能。对于含基质的样品,基于NNLS的PI-AI光谱分解通过分离与油相关的特征与纸张和马铃薯的贡献,显著改善了分类。优化的后剪枝模型分别在减纸和减纸加减马铃薯的数据集上实现了86.4%和85.4%的准确率,同时将重要拉曼变量的数量减少到仅五个和四个。紧凑的四特征表示进一步减少了99.44%的数据足迹,而没有损失分类准确率。总之,这些发现表明,通过物理意义明确、高度紧凑和可解释的光谱表示,可以实现准确的基于拉曼的油鉴定,为Frugal AI、Edge AI、便携式传感和嵌入式食品质量监测提供了有前景的基础。
查看缓存全文
缓存时间: 2026/08/24 04:29
# 食用油拉曼光谱的决策树与K-均值分析:一种物理信息驱动的AI方法 来源:https://arxiv.org/abs/2608.20440 查看PDF (https://arxiv.org/pdf/2608.20440) > 摘要:加工食品中食用油的真伪鉴别对食品质量控制、防范欺诈及法规遵从至关重要。本研究建立了一个整合拉曼光谱与机器学习的框架,将光谱的内在结构、可解释的分类能力与物理信息驱动的人工智能(PI-AI)相结合。研究通过t-SNE、K-均值聚类、决策树以及基于非负最小二乘(NNLS)的光谱分解技术,对五种纯食用油及其在炸薯片基质中的混合物进行了分析。无监督分析显示,纯油样本具有显著更强的类别组织性和可分性,而食品基质效应则带来了明显的光谱重叠。决策树模型仅使用原始1866维光谱特征空间中的四个拉曼变量,就实现了对纯油样本100%的分类准确率。这四个变量由预剪枝和后剪枝模型一致识别,仅占可用光谱信息的约0.21%,却保持了完美的测试集性能。对于含基质的样本,基于NNLS的PI-AI光谱分解通过分离油脂特征信号与纸袋及马铃薯的贡献,显著提升了分类效果。优化后的后剪枝模型在去除纸袋信号的数据集和去除纸袋及马铃薯信号的数据集上分别达到了86.4%和85.4%的准确率,同时将重要的拉曼变量数量减少至仅五个和四个。紧凑的四特征表示进一步将数据存储需求降低了99.44%,且未损失分类准确率。这些发现共同证明,通过物理意义明确、高度紧凑且可解释的光谱表征,可以实现基于拉曼光谱的精确油脂鉴别,为节俭型AI、边缘AI、便携式传感以及嵌入式食品质量监控提供了有前景的基础。 ## 提交历史 来自:Deepak Kallepalli 博士 \[查看邮件 (https://arxiv.org/show-email/91cf581c/2608.20440)\] **\[版本1\]** 2026年8月20日,星期四 14:07:32 UTC \(1,814 KB\)
相似文章
生物医学拉曼光谱的机器学习:从光谱采集到临床转化
本综述考察了机器学习在生物医学拉曼光谱流程中的作用,从预处理和信号校正到临床转化,强调了可靠Raman-AI系统的障碍和未来方向。
基于核Fisher判别分析的树集成分类器:KFDA Forest
提出了一种基于树的集成分类器KFDA Forest,它应用核Fisher判别分析进行旋转,通过Bootstrap和随机变量子集促进多样性,提高了分类精度。
FoodCHA:用于细粒度食物分析的多模态大语言模型智能体
本文介绍了 FoodCHA,这是一个专为细粒度食物分析设计的大语言模型多模态智能体框架,旨在解决饮食监测中的层级一致性和属性识别问题。
从ML预测到基于Toulmin论证模型的知情诊断辅助
本文提出一个框架,利用Toulmin论证模型对基于OCT图像的ML视网膜诊断进行结构化,整合生物标志物提取、医学大语言模型推理(MedGemma)和相似度度量(MedSigLip),以实现可解释且基于证据的诊断辅助。
基于线性判别树集合的可解释多模态分类
本文提出了一种基于线性判别树集合的可解释多模态分类框架,该框架在准确性和可解释性之间取得平衡,在F1-mod增益和人工标注者一致性分数上优于Transformer模型。