@Niccolg92: 与本帖相关的一个有趣事实。但首先是一些背景:在被OpenAI聘用后,Alisa Liu分享了…

X AI KOLs Timeline 新闻

摘要

本帖子强调了GLM-5.2论文附录中的一个动态规划公式,该公式类似于一道LeetCode题目,并与Alisa Liu被OpenAI聘用所引发的关于LeetCode相关性的争论联系在一起。

与本帖相关的一个有趣事实。但首先是一些背景: 在被OpenAI聘用后,Alisa Liu分享了一篇博客,详细介绍了她的求职经历和学习笔记,包括需要磨练她的LeetCode(LC)技能。在回复中,关于LC在当今世界相关性的无休止辩论再次被点燃,与往常一样。 基于此前提:在最近发布的GLM-5.2中,考虑了一个新颖的架构特性IndexShare,其目标是通过将“层子集化为一小组运行自己索引器的Full层和大多数直接重用最近Full层的top-k索引的Shared层”来进一步稀疏化DeepSeek稀疏注意力(DSA)。 为了确定哪些层应为Full或Shared,在论文正文中,他们提出了一种无训练和训练感知方法的组合,但最终在GLM-5.2中只考虑了后一种方法与均匀交错相结合。 然而,在同一篇论文的附录C中(此处附上),他们还报告了如何尝试使用动态规划公式来解决该问题。 考虑一个具有N层的DSA模型,并在校准集上执行N次前向传播。给定一对层(i, j),i > j,计算: “1. 使用层i自己的索引器时层i的核心注意力输出(即原始模型),以及 2. 重用层j的索引器时层i的核心注意力输出(即好像层i是一个从层j共享的S层)。” “这产生了一个N × N的下三角相似度矩阵S,其中S_{i,j}量化了层j的索引作为层i自身索引代理的优劣。直观上,如果S_{i,j}接近1,则层i可以安全地跳过自己的索引器计算,并重用层j的索引,对其注意力输出的扭曲最小。” 从图中可以看出,该问题确实可以通过动态规划解决:“令dp[i][k]表示在层1, ..., i中恰好使用k个F层且层i本身是F时可获得的最大累积相似度”。 如何转移到dp[i][k]? 考虑所有之前的j(F层)。计算以j结尾且使用更少一个F层的最佳模式的得分(按相似度),加上将j和i之间的所有层设为从j共享的S层的值,然后选择最佳的j。 虽然这种方法最终被证明是次优的,但在阅读它时,它确实让我想到了一个可能的LC挑战。 总体而言,这更多是一个有趣的巧合,而非对LC在当今世界相关性的声明:由读者自行评估类似LC的挑战是否仍然具有相关性。 此处附上之前提到的DP优化。下面还有我两天前分享的一篇关于IndexShare和Alisa Liu原帖的评论,包括她关于求职经历的优秀博客。
查看原文
查看缓存全文

缓存时间: 2026/06/25 09:16

这篇帖子附带了一个有趣的事实。不过先交代一些背景:

在被 OpenAI 聘用后,Alisa Liu 分享了一篇博客,详细介绍了她的求职经历和学习笔记,其中提到需要打磨她的 LeetCode(LC)技能。在各条回复中,关于 LC 在当今世界是否仍然相关的无休止辩论不出意外地被再次点燃。

基于这一前提:在最新发布的 GLM-5.2 中,考虑的一项新颖架构特性是 IndexShare,它旨在通过将“层划分为一个较小的全量层集合(这些层运行自己的索引器)和一个占多数的共享层集合(这些层直接复用最近的全量层的 top‑k 索引)”来进一步稀疏化 DeepSeek Sparse Attention(DSA)。

为了确定哪些层应该是全量层或共享层,论文主体提出了一种结合无训练和有训练意识的方法,但在 GLM-5.2 中最终只考虑了后一种方法与均匀交错相结合。

然而,在本文的附录 C(附于此处)中,他们还报告了如何尝试使用动态规划公式来解决该问题。

考虑一个有 N 层的 DSA 模型,在一个校准集上执行 N 次前向传递。给定一对层 (i, j),其中 i > j,计算:

“1. 当层 i 使用自己的索引器时的核心注意力输出(即原始模型),以及 2. 当层 i 复用层 j 的索引器时的核心注意力输出(即层 i 作为从层 j 共享的 S 层)。”

“这将产生一个 N × N 的下三角相似度矩阵 S,其中 S_{i,j} 量化了层 j 的索引作为层 i 自身索引代理的效果。直观地说,如果 S_{i,j} 接近 1,那么层 i 可以安全地跳过自己的索引器计算,直接复用层 j 的索引,而对其注意力输出的影响最小。”

从图中可以看出,该问题确实可以通过动态规划解决:“设 dp[i][k] 表示层 1, . . . , i 在恰好使用 k 个 F 层且层 i 本身为 F 时所能达到的最大累积相似度。”

如何转移到 dp[i][k]?

考虑所有之前的 j F 层。对旧的以 j 结尾且少用一个 F 层的最优模式进行评分(基于相似度),再加上使 j 和 i 之间的所有层都成为从 j 共享的 S 层的值,然后选出最优的 j。

虽然这种方法最终被证明并非最优,但在阅读它时,它的确让我想到了一道可能的 LC 挑战题。

总的来说,这更像是巧合而非对 LC 在当今世界相关性的陈述:由读者自行评判 LC 这类挑战是否仍然具有相关性。

附件中是前面提到的 DP 优化。下面还有我两天前分享的关于 IndexShare 和 Alisa Liu 原始帖子的评论,包括她关于求职历程的优秀博客。

Alisa Liu 的帖子:

我对 IndexShare 的更详细评论:

同样来自论文,该问题的完整动态规划公式:

相似文章

动态规划的故事(2022)

Hacker News Top

一篇深入浅出的教育性文章,探讨动态规划作为最短路径算法、神经网络训练和上下文无关文法解析背后的统一原理,并将自动机、最优控制和线性规划联系在一起。