如何评估你的脏数据中是否有强信号 [项目]
摘要
Entropic Scree 是一个新的诊断工具,用于评估脏表格数据中的信号强度和结构,使用互信息,附带预印本和即将推出的 Python 和 R 包。
我分享这个新的表格数据诊断工具(Entropic Scree)。它可以用来估计你的高维、真实世界、脏数据集的这些属性:
- 信号的信息量(即帮助你评估信号是否足够强,以抵御数据集的特有量)。
- 整体信号与特有量之比(信噪比,SNR)。
- 内在秩。
- 提供一个探索性地图,允许识别变量的去耦合子网络。
- 线性充分性(即数据集是否与标准PCA的线性假设一致?)。
与传统的PCA变体评估线性方差、秩顺序或欧几里得距离不同,这种新方法评估一个转换后的互信息度量。相对于这些基线,它较少依赖强参数或距离假设,使其适合更广泛地应用。它还作为From Garbage to Gold框架中探索的理论的实际诊断,该框架描述了何时以及为什么未整理的、易出错的数据可以直接用于创建准确的预测模型。
有一个预印本提供了完整的技术细节,Python和R包即将发布。不过目前,原始函数已经在R中可用(参见下面的快速启动R函数代码)。
Entropic Scree 预印本: https://doi.org/10.5281/zenodo.22028087
Entropic Scree GitHub: https://github.com/tjleestjohn/entropic-scree
From Garbage to Gold 预印本: https://arxiv.org/abs/2603.12288
如果你尝试了,请让我知道结果……或者如果你有任何问题或评论,当然。
############
# 快速启动R函数代码。
# 要加载函数,将以下内容复制并粘贴到你的R控制台中,然后按回车。
############
# 1. 定义GitHub上原始函数脚本的直接URL
url <- "https://raw.githubusercontent.com/tjleestjohn/entropic-scree/main/Entropic.Scree.v1.0.0%20-%20ENLI.R"
# 2. 定义你想在计算机上命名的文件名
file_name <- "Entropic.Scree.v1.0.0 - ENLI.R"
# 3. 将脚本下载到你当前的工作目录
download.file(url, destfile = file_name)
# 4. 将核心函数源入你的R环境
source(file_name)
# 5. 示例:运行函数并提取双极模块:
# results <- Entropic.Scree(dt # , extract_bipolar_modules = TRUE)
#
# 查看提取的主要轴的结构子网络:
# results$bipolar_modules
相似文章
需要在大规模、杂乱的表格数据上估计秩或执行降维吗?Entropy Scree 是 PCA 的一种基于信息论的升级方法。
Entropy Scree 是 PCA 的信息论升级版,用于在杂乱的表格数据上进行稳健的秩估计和降维,代码已开源,预印本已发布。
在复杂表格数据中映射内在秩与信息引力:我开发了一种非参数、模型无关、基于信息论的诊断工具,以绕过线性、秩和欧几里得基线的限制。[R]
Entropic Scree 是一种非参数、基于信息论的诊断框架,用于在复杂表格数据中映射内在秩与信息引力,解决了标准 PCA 和其他基线的局限性。
无需数据清洗即可获得高质量预测(为何“垃圾进,垃圾出”有时是一种误区)
这篇arXiv预印本挑战了“垃圾进,垃圾出”的经验法则,认为在高维表格数据中,激进的手动数据清洗可能会通过减少三角测量潜在驱动因素所需的维度,从而限制预测性能。
打破结构孤立:通过社区感知采样和结构熵的可扩展图聚类
本文提出SCISE,一个可扩展的无监督图聚类框架,通过社区感知采样和结构熵克服小批量训练中的结构孤立问题,在基准数据集上取得了最先进的结果。
Perturbation Sensitivity at Convergence: A Simple Signal for Identifying Spuriously Correlated Samples
This paper proposes a method to identify spuriously correlated samples after model convergence by measuring prediction fragility under input perturbation, requiring no group labels or early-stopping epochs. Rebalancing training with detected samples improves worst-group accuracy on Waterbirds from 57.3% to 80.8%.