需要在大规模、杂乱的表格数据上估计秩或执行降维吗?Entropy Scree 是 PCA 的一种基于信息论的升级方法。

Reddit r/ArtificialInteligence 论文

摘要

Entropy Scree 是 PCA 的信息论升级版,用于在杂乱的表格数据上进行稳健的秩估计和降维,代码已开源,预印本已发布。

这是我正在研究的一个新的秩估计方法。它基本上是一种基于信息论而非线性方差的升级版主成分分析(PCA)。它对混合数据类型、高度非线性的生成过程、低信噪比和稀疏性(变量多于样本)具有鲁棒性。当你需要精确确定数据集的秩以显式设置神经瓶颈(如自编码器)时,它尤其有用。我刚刚开源了代码并发布了预印本。我很想听听你们的看法,或者如果你们在自己的数据上测试了它的话!GitHub(R代码):https://github.com/tjleestjohn/Entropic-Scree 预印本:https://doi.org/10.5281/zenodo.22028087
查看原文

相似文章