标签
本文提出了一个统一的几何框架,用以理解 t-SNE 和 UMAP 等可微嵌入,表明现有的诊断方法源自同一个几何对象,并提出了新的基于曲率和积分路径的信任度量。
本文研究了使用Whisper进行波斯语语音情感识别,表明基于PCA的降维方法提升了性能和效率,而ASR微调仅带来有限的改进。
本文系统比较了表格基础模型(TabPFN)与经典回归方法在85项土壤光谱任务中的表现,发现TabPFN结合PLSR衍生特征在从田间尺度到全球光谱库的预测性能上均达到最优。
FADEx 提出了一种新颖的局部逐实例特征归因方法,用于解释降维技术,利用泰勒展开和奇异值分解提供模型无关的解释和失真分析。
FloDR是一种基于归一化流的降维方法,可生成可逆嵌入,同时保留局部和全局结构,并提供如条件扩展和隐藏对比等诊断工具。
CLOE是一种新的半监督异常检测方法,结合了自编码器与基于Christoffel函数的检测器,通过一种新颖的损失函数来改进表示学习。该方法在高维表格数据上取得了最先进的结果,同时保持了简单性。
本文介绍了ODIN,一种新颖的自编码器架构,它强制潜在维度正交并按照重要性排序,在全非线性条件下恢复类似PCA的可解释性。该方法将几何约束集成到训练目标中,具有理论依据,并在合成数据集和真实数据集上进行了实证验证。
提出了一种将图嵌入高维空间并搜索信息性二维视角的方法,这些视角优化了美学和可读性指标(例如边交叉和角分辨率),这得益于一种新颖的边交叉可微替代方法。引入了一个交互式系统DataFly,用于探索多个候选视角。
提出了GraphDR-LinUCB方法,一种面向具有图结构臂的上下文赌博机方法,该方法将特征投影到图的低频频谱子空间上。实现了首个基于频谱投影的上下文赌博机的遗憾界,并在真实数据集上相比全维度LinUCB实现了15倍的遗憾值降低。
本文提出了利用Schur补和Sylvester行列式恒等式的精确降维方法,将非平滑NML估计中每步的计算复杂度从O(N^3)降低到O(k^3+N^2k),在保持数值精度的同时实现了超过14,000倍的加速。
提出距离自适应表示(DAR),该方法对远距离token降低键值维度,同时保留附近token的全维度,在不损失性能的前提下提升KV缓存效率。
该研究揭示了LLM文本嵌入被高频token(如句号、冠词)绑架的问题,提出EmbedFilter方法通过对unembedding矩阵进行SVD分解并减去投影分量来释放真实语义,实现零训练开销的降维和检索效率提升。
本文指出,LLM文本嵌入过度表达了高频无信息词元,并提出EmbedFilter,一种线性变换,通过滤除该子空间来改善语义表示并实现降维。
一篇关于主成分分析(PCA)的简短数学文章,解释了概念及其应用。
ScaleMAP是一种新的非线性降维方法,通过基于原始空间局部半径重新缩放嵌入距离来保持局部密度和邻域结构,在保持UMAP级别邻域保留的同时,实现了比DensMAP更好的密度保留。
提出DIVE,一种用于嵌入维度缩减的压缩适配器,采用自限制梯度更新和头部级NT-Xent对比损失,防止在小数据集上过拟合,在BEIR基准测试上优于现有方法。
本文提出了一种面向小数据场景下植物表型组学分类的混合量子-经典工作流,通过监督潜在重构(PCA+LDA)在量子核对齐前提升几何可分性。实验显示可分性有所提升,但揭示了压缩权衡以及实现强量子性能的困难。
本文提出了一种无监督框架,通过混合潜空间建模来模拟结构连接组中与获取相关的变异,利用架构退火编码器输出消除了手动容量调优的需求。
本文提出了一种名为 Spectra 的方法,利用光谱占用率来分析和控制潜在图模型的实际容量,并论证了模型的秩并不等同于其容量。