二元少样本分类的光谱相图:内在维度、几何饱和与表征诊断
摘要
本文提出了一种二元少样本分类的光谱相图,通过分析内在维度和几何饱和进行表征诊断。
arXiv:2606.24903v1 公告类型:新
摘要:在应用机器学习中,决定何时停止收集标注样本是一个基本但理论化不足的问题。饱和指数 $S(K) = \operatorname{erank}(\widehat{\Sigma}_W^{(K)}) / K$ 测量的是池化类内样本协方差的有效秩与样本数量的比率;我们证明,当协方差估计量在总体协方差附近良好集中且线性判别器稳定时,该指数会降至阈值以下。该指数仅需支持特征即可在 $O(d^3)$ 时间内计算,无需测试标签或训练好的分类器。
在来自17个二元任务和6个数据集的 $N = 246$ 个倍增对观测值上进行评估,17个任务中有16个任务的 $S(K)$ 与边际准确率增益之间存在正向的任务内斯皮尔曼相关性(中位数 $\rho = 0.811$)。合并后的斯皮尔曼相关性为 $\rho = 0.548$($p = 1.1 \times 10^{-20}$,$N = 246$)。一个三阶段相图(探索、过渡、饱和)的边际平均增益分别为 $3.48\%$、$2.40\%$ 和 $0.82\%$,所有成对显著性检验均支持这一结论($p \leq 0.008$)。作为一种二元停止规则,该指数的 AUC 为 $0.752$,为标注决策提供了有意义的概率指导。渐近有效秩与峰值准确率在各任务之间没有显著的单调关系(斯皮尔曼 $r_s = 0.380$,$p = 0.133$,$N = 17$)。小的饱和指数加上低准确率表征了表征能力的不足。所有结果均针对固定线性分类器的二元分类;扩展到 N-way 设置和预训练骨干表征作为未来工作进行讨论。
查看缓存全文
缓存时间: 2026/06/25 05:07
# 二元小样本分类的光谱相图:本征维度、几何饱和与表征诊断 来源:https://arxiv.org/abs/2606.24903 文献工具 ## 文献与引用工具 文献浏览器 切换 代码、数据、媒体 ## 本文关联的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 IArxiv推荐器 切换 关于arXivLabs ## arXivLabs:与社区合作者的实验性项目 arXivLabs是一个框架,允许合作者直接在arXiv网站上开发和分享新的arXiv功能。 与arXivLabs合作的个人和组织均已接受并认同我们在开放性、社区、卓越和用户数据隐私方面的价值观。arXiv坚守这些价值观,并只与遵循这些价值观的合作伙伴合作。 有能够为arXiv社区增加价值的项目创意吗?**了解更多关于arXivLabs的信息** (https://info.arxiv.org/labs/index.html)。
相似文章
从超平面到超椭球:线性与单量子比特混合态二分类模型的内在可解释性表征
本文系统表征了线性模型与单量子比特混合态模型在二分类任务中的内在可解释性差异,揭示了量子模型学习的是超椭球而非超平面,并探讨了这一发现对归纳偏置及教学法的启示。
思维的谱几何:相变、指令反转、Token级动力学与Transformers推理中的完美正确性预测
对11个大型语言模型的全面谱分析,揭示了Transformers在推理与事实回忆过程中隐层激活空间中的相变现象,发现了七个基本现象,包括谱压缩、指令微调反转以及仅基于谱特性的完美正确性预测(AUC=1.0)。
特征抽奖?概念涌现的分岔理论
本文提出了一种表征动力学的分岔理论,用于检测神经网络在训练过程中何时获得结构化表征。该理论利用对GMM探针的黑塞矩阵分析,得到的比值β/β_c作为一种无标签的相位坐标,能够预测可用结构的出现,并在训练早期预判稀疏自编码器中的特征可解释性。
Bag of Dims: 基于维度级符号模式的无需训练机制可解释性
提出了Bag of Dims框架,表明Transformer隐藏状态的标准基提供了一种无需训练、架构通用的特征表示,其中维度通过符号模式编码语义内容;在语言、视觉和音频模型上得到验证,无需学习旋转即可实现高精度。
Bifocal Attention: 协调几何与频谱位置嵌入以实现算法泛化
本文介绍了Bifocal Attention,它将位置编码解耦为几何(标准RoPE)和频谱(Learnable Harmonic Operators)两种模态,以解决固定RoPE的'Spectral Rigidity'问题,从而改善超出训练窗口的算法泛化能力。