如何用高维统计赢得一杯啤酒
摘要
本文探讨了一篇热门论文,该论文显示LLM对月份的嵌入在PCA空间中投影成圆形,具有循环Gram矩阵,并描述了一个实验,寻找表现出类似几何性质的看似随机的单词。
暂无内容
查看缓存全文
缓存时间: 2026/09/29 01:50
# 如何用高维统计赢得一杯啤酒
来源:https://jamiesimon.io/blog/how-to-win-a-beer-with-high-dimensional-statistics/
我那位实验室好友兼学生(注:原文为"实验室伙伴转型的学生/朋友1")德鲁瓦·卡卡达最近在数据统计领域发表了一篇令人惊艳的论文(https://arxiv.org/abs/2602.15029),在推特上理所当然地引发热议——部分原因是它包含了我见过最美的科学图表之一:
月份嵌入在PCA空间中形成圆形,伴随循环格拉姆矩阵
假设我们有一个词汇表 $\\mathcal\{V\}$,其中包含若干单词。本文研究的模型 $f$ 将 $f: \\mathcal\{V\} \\rightarrow \\mathbb\{R\}^d$:即把每个单词映射为 $d$ 维向量。我们令 $\\\{v\_i\\\}\_\{i=1\}^\{12\} = \\\{\\texttt\{January\}, \\texttt\{February\}, \\ldots\\\}$ 代表一年中的月份,取对应的12个嵌入向量 $\\mathbf\{w\}\_i = f\(v\_i\)$,并计算以下两个结果:
- 将 $\\\{ \\mathbf\{w\}\_i \\\}$ 投影到前两个PCA主方向(左栏),以及
- 格拉姆矩阵 $\\mathbf\{M\} \\in \\mathbb\{R\}^\{12 \\times 12\}$,其中 $M\_\{ij\} = \\mathbf\{w\}\_i^\\top \\mathbf\{w\}\_j$(右栏)。
从上至下阅读图表各行(注:原文脚注2链接),他们发现:
1. 大语言模型嵌入经PCA投影后形成圆形(与Engels等人(2024)的发现一致),且格拉姆矩阵近似为循环矩阵;
2. 即使用原始的`word2vec`嵌入也能较好复现这些发现;
3. 循环格拉姆矩阵的解析理论呈现出极具说服力的匹配效果。
这具有重要意义,因为它通过简洁的数学理论将数据统计与表征几何联系起来。
### 密林寻针
在多次目睹此现象并凝视良久后,我萌生了给这个优美结果挑刺的冲动,于是向德鲁瓦打赌我能找到一组*其他看似无关的单词*,使其在相同意义上形成圆形+循环矩阵结构。他(以及我告知的大多数人)都认为这不可能,因为圆形显然源于词汇间的特殊关联。我们商定赌约条件:我需要找到十个看似随机的单词,使其`word2vec`嵌入经上述处理后形成清晰且具说服力的圆形。
为何我认为这可能实现?首先,我们拥有25000个可选词汇,组合数 $N = \\binom\{25000\}\{10\} \\approx 3 \\times 10^\{37\}$ 种选择。我推测若将十支飞镖投射如此多次,至少一次会命中圆形。从信息论角度,你拥有 $\\log\_2 N \\approx 124$ 比特的信息量,凭借这种解析度完全可能构建合理的十点圆形。关键在于如何从浩瀚词汇中找出这十个优质单词。
我的实现路径如下:
- 通过观察随机组合的PCA散点图,我估计随机选择能产生较好圆形的概率约为 $3^\{-10\}$,因此随机尝试可能有效。
- 我编写了“形状圆度”目标函数,生成数万组随机组合后选取最优解。结果尚可,但不足以彻底击败德鲁瓦。
- 我将方法升级为迭代搜索:每一步剔除最差的点,从词汇表中选择最佳替代点。效果显著提升。
- 我还将目标函数从“PCA图上看起来圆”改为“匹配目标循环格拉姆矩阵”。这方法效果极佳。
需注意嵌入维度 $d = 10000$ 始终未介入决策过程。借助编程助手,整个过程耗时仅一个下午。
最终结果如图所示:
十个看似无关的单词在PCA空间形成圆形,伴随循环格拉姆矩阵
确实呈现圆形特征。你完全可以找到其他类似的随机单词组合形成圆形结构!
### 这具有实际意义吗?
这引出若干开放问题,包括“一个人怎么可能如此错误?”——对此我无权置评。
但严肃来说:我们显然能构造虚假的几何模式。这是否应改变我们对表征几何的理解?我建议首先考虑几点限制:
1. 虽然我的虚假圆形组合的格拉姆矩阵确实呈现美妙循环性,但其(正弦式)非对角线振幅低于月份组合。我始终无法使其匹配月份格拉姆矩阵,差距甚至超过两倍。
2. 该方法对十个单词的组合效果显著,但我怀疑对五十个单词(虽然我未深入尝试)的组合未必适用——因此德鲁瓦关于年份序列(如1700-2020年)的其他几何发现无法通过此方式伪造。
尽管如此,它确实表明:若目标缺乏足够统计约束以避免随机巧合,任何针对特定低维PCA几何的追求匹配式搜索都会产生误导!这确实排除了某些自动特征发现算法的有效性,对可扩展可解释性等研究方向具有启示意义。
---
相似文章
亲爱的,我把嵌入缩小了:Matryoshka 与 PCA
Dylan Castillo 比较了 Matryoshka 表示学习(MRL)与主成分分析(PCA)在降低嵌入维度方面的效果,并在八个 BEIR 数据集上进行了实验,以评估检索质量与向量大小缩减之间的权衡。
@probnstat: 每位机器学习工程师都应了解的一个定理:Johnson-Lindenstrauss 引理。它指出,高维数据可以……
本文重点介绍了 Johnson-Lindenstrauss 引理,解释了其在帮助机器学习工程师理解降维、随机投影和嵌入效率方面的重要性。
LLM生成样本的几何过滤在少样本文本分类中的应用
本文提出了一种几何过滤框架,通过评估LLM生成样本在嵌入空间中与真实类别示例的欧氏距离来选择高质量样本,从而将少样本文本分类性能提升了2.61个百分点,优于SMOTE方法。
数据偏心性、高斯RBF再生核希尔伯特空间的渐近性及核PCA
本文证明,在大带宽条件下,高斯RBF再生核希尔伯特空间渐近等距于欧几里得空间,导致核PCA收敛到线性PCA。一种数据偏心性度量能够预测前几个主方向上的收敛行为。
词-文档矩阵谱共聚类的随机化SVD近似方法
本文提出了两种用于词-文档矩阵谱共聚类的随机化SVD近似方法,表明在多种设置下随机投影方法更为可靠,而基于采样的方法在更密集的矩阵上表现更佳。