二元少样本分类的光谱相图:内在维度、几何饱和与表征诊断

arXiv cs.LG 论文

摘要

本文提出了一种二元少样本分类的光谱相图,通过分析内在维度和几何饱和进行表征诊断。

arXiv:2606.24903v1 公告类型:新 摘要:在应用机器学习中,决定何时停止收集标注样本是一个基本但理论化不足的问题。饱和指数 $S(K) = \operatorname{erank}(\widehat{\Sigma}_W^{(K)}) / K$ 测量的是池化类内样本协方差的有效秩与样本数量的比率;我们证明,当协方差估计量在总体协方差附近良好集中且线性判别器稳定时,该指数会降至阈值以下。该指数仅需支持特征即可在 $O(d^3)$ 时间内计算,无需测试标签或训练好的分类器。 在来自17个二元任务和6个数据集的 $N = 246$ 个倍增对观测值上进行评估,17个任务中有16个任务的 $S(K)$ 与边际准确率增益之间存在正向的任务内斯皮尔曼相关性(中位数 $\rho = 0.811$)。合并后的斯皮尔曼相关性为 $\rho = 0.548$($p = 1.1 \times 10^{-20}$,$N = 246$)。一个三阶段相图(探索、过渡、饱和)的边际平均增益分别为 $3.48\%$、$2.40\%$ 和 $0.82\%$,所有成对显著性检验均支持这一结论($p \leq 0.008$)。作为一种二元停止规则,该指数的 AUC 为 $0.752$,为标注决策提供了有意义的概率指导。渐近有效秩与峰值准确率在各任务之间没有显著的单调关系(斯皮尔曼 $r_s = 0.380$,$p = 0.133$,$N = 17$)。小的饱和指数加上低准确率表征了表征能力的不足。所有结果均针对固定线性分类器的二元分类;扩展到 N-way 设置和预训练骨干表征作为未来工作进行讨论。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:07

# 二元小样本分类的光谱相图:本征维度、几何饱和与表征诊断
来源:https://arxiv.org/abs/2606.24903
文献工具

## 文献与引用工具

文献浏览器 切换

代码、数据、媒体

## 本文关联的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

IArxiv推荐器 切换

关于arXivLabs

## arXivLabs:与社区合作者的实验性项目

arXivLabs是一个框架,允许合作者直接在arXiv网站上开发和分享新的arXiv功能。

与arXivLabs合作的个人和组织均已接受并认同我们在开放性、社区、卓越和用户数据隐私方面的价值观。arXiv坚守这些价值观,并只与遵循这些价值观的合作伙伴合作。

有能够为arXiv社区增加价值的项目创意吗?**了解更多关于arXivLabs的信息** (https://info.arxiv.org/labs/index.html)。

相似文章

特征抽奖?概念涌现的分岔理论

arXiv cs.LG

本文提出了一种表征动力学的分岔理论,用于检测神经网络在训练过程中何时获得结构化表征。该理论利用对GMM探针的黑塞矩阵分析,得到的比值β/β_c作为一种无标签的相位坐标,能够预测可用结构的出现,并在训练早期预判稀疏自编码器中的特征可解释性。

Bag of Dims: 基于维度级符号模式的无需训练机制可解释性

Hugging Face Daily Papers

提出了Bag of Dims框架,表明Transformer隐藏状态的标准基提供了一种无需训练、架构通用的特征表示,其中维度通过符号模式编码语义内容;在语言、视觉和音频模型上得到验证,无需学习旋转即可实现高精度。