标签
本文研究了大语言模型(LLM)中的随机采样(自一致性)能否捕捉类似于多样化集成的跨问题结构。通过使用Marchenko–Pastur检验,作者发现,在单个模型内,随机变异最多产生一个显著维度,而24个模型的集成则产生四个,揭示了限制自一致性作为集成替代方案的维度差距。
本文提出了一种基于马尔钦科-帕斯图尔随机矩阵的深度神经网络剪枝方法,提供了理论保证,并在 ImageNet 上对 ViT 和 CNN 架构实现了高精度保持,仅需极少的微调。