在复杂表格数据中映射内在秩与信息引力:我开发了一种非参数、模型无关、基于信息论的诊断工具,以绕过线性、秩和欧几里得基线的限制。[R]

Reddit r/MachineLearning 工具

摘要

Entropic Scree 是一种非参数、基于信息论的诊断框架,用于在复杂表格数据中映射内在秩与信息引力,解决了标准 PCA 和其他基线的局限性。

链接:Entropic Scree Function v1.0.0 / GitHub: https://github.com/tjleestjohn/Entropic-Scree 预印本: https://doi.org/10.5281/zenodo.22028087 简而言之:标准 PCA 从根本上将非线性依赖关系断裂为“伪正交维度”,严重高估了复杂表格系统的真实秩。同时,像 Kernel PCA 和欧几里得最近邻估计器这样的非线性替代方案在生成根源纠缠或稀疏时会遭受结构崩溃。我在这里分享方法和代码,供任何处理这些复杂表格数据噩梦的人使用。该方法和开源框架使用归一化互信息将伪扩展压缩回其真实生成根源。它还映射根源的底层“信息引力”,提供关于整体平均稳定性的见解,以及哪些特定根源可以最可靠地提取;估计数据的共享信号与非共享特有信息方差(噪声)的整体比率;作为一个强大的探索性地图,分离不相关的变量簇,使您能够轻松识别解耦的子网络。现代机器学习架构蓝图:远不止是遗留因子分析工作流程的更新,识别这种精确的内在秩允许您明确地为下游非参数流形提取器(如自编码器)调整神经瓶颈大小。标准基线的问题:当试图映射数据集的内在维度时,标准做法通常指向使用 PCA、其非线性核扩展或欧几里得最近邻估计器。但如果您的表格环境具有混合数据类型、重度非线性、纠缠根源或特征多于样本($m > N$),这些既定基线不仅失去精度。它们遭受结构崩溃。我们标准基线的核心问题:标准 PCA 导致维度膨胀。因为它只测量线性协方差,它将多项式扩展或非线性交互(如 $X_1 X_2$)视为完全独立的变量。它被迫制造新的、伪正交维度来映射它们。Kernel PCA (RBF) 遭受结构崩溃。投影到希尔伯特空间并不能解决这个问题。KPCA 人为地将偶多项式折叠到独立轴上。此外,由于其无限维空间缺乏有限样本边界,稀疏组合噪声会扩散到升高的尾部,掩盖结构拐点。如果底层生成根源即使轻微纠缠,KPCA 也会遭受完全结构崩溃。拓扑估计器(欧几里得)在稀疏场景中失败。像 TWO-NN 或 MLE 这样的估计器依赖于欧几里得距离度量。在非对称、特征丰富的环境($m > N$)中,它们遭受距离集中(最近和最远邻居的比率收敛到 1)。这使得跨混合数据边界的局部邻域计算在结构上退化。介绍 Entropic Scree:为了解决这个问题,我构建了 Entropic Scree。它完全抛弃线性和空间方差,评估纯概率质量。以下是其底层工作原理:度量空间:它使用信息论 Jaccard 相似度(信息变异)评估成对依赖关系。因为这依赖于香农熵,它对边际形状不匹配(如混合连续波形与二进制标志)是不变的。绕过秩上限:标准 PCA 在代数上受限于 $N-1$。通过移动到双重中心拓扑信息空间,我们映射真实的重叠冗余,并完全绕过代数样本大小上限。压缩流形:该算法充当双变量过滤器。它内在地将非线性组合的主要重叠概率质量压缩回内在生成秩。它剪切掉独特的协同方差,留下形成有界扩展信号尾部的残差,干净地分离真实驱动力和无结构的特有信息方差。量化信息引力:除了提取离散秩,该框架通过引入信息引力(AIG/FSIG)将秩与概率体积解耦。通过系统地重新捆绑被双变量过滤器剪切掉的残差方差,它将抽象矩阵属性转换为可操作的、“变量等效”足迹。经验压力测试:为了演示理论边界,我构建了一个高度纠缠的合成数据集,其中 20 个纯生成根源扩展为 5 阶组合,跨越 20,000 个代理,但只有 10,000 个样本($m > N$)。为了真正模拟混乱的现实世界上下文,我还向数据中大量注入了特有结构噪声和测量误差。标准 PCA 达到了秩上限,线性断裂扩展,并错误地提取了约 5,700 个维度。Kernel PCA (RBF) 和 Spearman 秩在结构上折叠,并产生秩的自由高估达 100%。当引入根源纠缠时,它们完全失去了拐点,并遭受了完全结构崩溃。Entropic Scree 正确地将内在秩映射为恰好 20。它成功地从压倒性的 98.55% 无结构特有信息方差中仅隔离了 1.45% 的活跃共享信号。此外,残差形成了一个扩展信号尾部,与全局超几何设计空间的确定性限制完美对齐。映射隐藏拓扑:使用因子特定信息引力(FSIG),该框架成功地逆向工程了仿真的隐藏架构。拓扑轮廓诊断了一个大主维度($FSIG_1 \approx 74.5$ 变量等效)映射网络的全局组合枢纽,随后是其余 19 个维度(各约 $11.5$)的平坦高原,确认在极端纠缠下分布的民主根系统。反馈/讨论:您当前如何处理这些混乱复杂表格环境中的内在秩提取?如果您正在与样本匮乏、重度非线性生成数据集搏斗,而标准 PCA 和其他基线工具不起作用,我希望您拉取 Entropic Scree 仓库并自己测试。我完全开放反馈,所以请让我知道它对您如何表现,我很乐意讨论机制。
查看原文

相似文章

Transformer的熵界:为何静态秩失效而注意力原生秩恢复

arXiv cs.LG

本文介绍了熵界(Entropic Bound),这是一种针对Transformer的任务内在容量的谱度量,证明了令牌混合算子的内在秩为所需模型容量提供了一个紧的下界。本文表明,虽然从线性注意力到真实注意力的简单迁移会失败,但注意力原生的内在秩能恢复完整的理论结构。