@Niccolg92: 与本帖相关的一个有趣事实。但首先是一些背景:在被OpenAI聘用后,Alisa Liu分享了…
摘要
本帖子强调了GLM-5.2论文附录中的一个动态规划公式,该公式类似于一道LeetCode题目,并与Alisa Liu被OpenAI聘用所引发的关于LeetCode相关性的争论联系在一起。
查看缓存全文
缓存时间: 2026/06/25 09:16
这篇帖子附带了一个有趣的事实。不过先交代一些背景:
在被 OpenAI 聘用后,Alisa Liu 分享了一篇博客,详细介绍了她的求职经历和学习笔记,其中提到需要打磨她的 LeetCode(LC)技能。在各条回复中,关于 LC 在当今世界是否仍然相关的无休止辩论不出意外地被再次点燃。
基于这一前提:在最新发布的 GLM-5.2 中,考虑的一项新颖架构特性是 IndexShare,它旨在通过将“层划分为一个较小的全量层集合(这些层运行自己的索引器)和一个占多数的共享层集合(这些层直接复用最近的全量层的 top‑k 索引)”来进一步稀疏化 DeepSeek Sparse Attention(DSA)。
为了确定哪些层应该是全量层或共享层,论文主体提出了一种结合无训练和有训练意识的方法,但在 GLM-5.2 中最终只考虑了后一种方法与均匀交错相结合。
然而,在本文的附录 C(附于此处)中,他们还报告了如何尝试使用动态规划公式来解决该问题。
考虑一个有 N 层的 DSA 模型,在一个校准集上执行 N 次前向传递。给定一对层 (i, j),其中 i > j,计算:
“1. 当层 i 使用自己的索引器时的核心注意力输出(即原始模型),以及 2. 当层 i 复用层 j 的索引器时的核心注意力输出(即层 i 作为从层 j 共享的 S 层)。”
“这将产生一个 N × N 的下三角相似度矩阵 S,其中 S_{i,j} 量化了层 j 的索引作为层 i 自身索引代理的效果。直观地说,如果 S_{i,j} 接近 1,那么层 i 可以安全地跳过自己的索引器计算,直接复用层 j 的索引,而对其注意力输出的影响最小。”
从图中可以看出,该问题确实可以通过动态规划解决:“设 dp[i][k] 表示层 1, . . . , i 在恰好使用 k 个 F 层且层 i 本身为 F 时所能达到的最大累积相似度。”
如何转移到 dp[i][k]?
考虑所有之前的 j F 层。对旧的以 j 结尾且少用一个 F 层的最优模式进行评分(基于相似度),再加上使 j 和 i 之间的所有层都成为从 j 共享的 S 层的值,然后选出最优的 j。
虽然这种方法最终被证明并非最优,但在阅读它时,它的确让我想到了一道可能的 LC 挑战题。
总的来说,这更像是巧合而非对 LC 在当今世界相关性的陈述:由读者自行评判 LC 这类挑战是否仍然具有相关性。
附件中是前面提到的 DP 优化。下面还有我两天前分享的关于 IndexShare 和 Alisa Liu 原始帖子的评论,包括她关于求职历程的优秀博客。
Alisa Liu 的帖子:
我对 IndexShare 的更详细评论:
同样来自论文,该问题的完整动态规划公式:
相似文章
动态规划的故事(2022)
一篇深入浅出的教育性文章,探讨动态规划作为最短路径算法、神经网络训练和上下文无关文法解析背后的统一原理,并将自动机、最优控制和线性规划联系在一起。
@stanfordnlp: “我开始了我的过程,首先观看了斯坦福大学的《从头开始的语言建模》课程的所有讲座,这有助于……”
Alisa Liu 宣布她将加入 OpenAI,并分享了一篇关于求职经历的博客文章,其中包含来自斯坦福大学《从头开始的语言建模》课程的见解。
@yong_zhengxin: 下个月加入@openai!看到大家对Alisa关于她经历帖子的反应后,我也写下了一些…
一位博士生宣布即将加入OpenAI,并分享了一篇博客文章,其中包含从研究科学家求职中获得的令人意外的教训,包括只有少数论文重要,以及面试常常现场测试解决问题的能力。
@huskydogewoof: 刚刚花了20分钟读Alisa的求职博客,里面有很多有用的内容!她下周将加入OpenAI,并分享了很多笔记……
Alisa Liu将于下周加入OpenAI,并分享了一篇包含求职笔记的博客,其中包括LLM和数学资源。
@mylifcc: Alisa Liu(UW NLP PhD)刚刚拿到了 OpenAI Research Scientist 的 offer! 她把整个求职过程写成了一篇笔记,干货拉满。尤其是下面这几点,对想进顶级 AI Lab 的人特别有价值: • 先建立…
Alisa Liu(UW NLP PhD)分享了拿到OpenAI Research Scientist offer的求职经验,包括系统学习、深度实践、手写Transformer等建议。