大型语言模型们渴望“脊柱”
摘要
本文探讨了大型语言模型在代码项目中频繁使用“脊柱”一词的现象,该结论基于GitHub拉取请求数据,并讨论了“门”等词的类似趋势。
<p class="empty-line" style="height:16px; margin:0px !important;"></p>
<p>今年早些时候,我处理了几个由AI生成的TLA+规范,注意到它们都在某处使用了“spine”这个词。后来,我又看到一些非TLA+的公共项目也用了“spine”,便开始好奇这是不是一种新的“LLM现象”(LLM主义?)。</p>
<p>如果是,我们应该能看到使用“spine”的代码项目数量出现一个不连续的跃升。要彻底探究此事,正确的方法是通过<a href="https://www.gharchive.org/" target="_blank">GitHub archive</a>数据转储进行,但那会耗费无限时间,况且我现在有一份全职工作。因此,我决定使用<a href="https://buttondown.com/hillelwayne/archive/github-search-for-research-and-learning/" target="_blank">GitHub搜索</a>。我们无法按日期筛选代码片段,但可以筛选拉取请求,这似乎是一个足够好的代理指标。</p>
<p>以下是每年标题中包含“spine”的公开拉取请求数量图表:</p>
<p><img alt="一张柱状图,显示了每年包含'脊柱'的PR数量,从2020年(不到一千)到2026-09-01(超过17,000)" class="newsletter-image" src="https://assets.buttondown.email/images/ba001783-041b-4c65-998c-4d8ff9bbc3e9.png?w=960&fit=max" /></p>
<p>我将2026年的数据截止到2026-09-01,这意味着今年前九个月的“spine”PR数量是整个2025年的20倍。现在,这<em>可能</em>是因为GitHub在过去一年里规模增长巨大。也许20倍的增长是由于拉取请求总量增加了20倍所致。我们可以通过将其与<a href="https://github.com/search?q=created%3A2026-01-01..2026-09-01&type=pullrequests" target="_blank">所有公开PR</a>进行比较来解释这一点:<sup id="fnref:gergely"><a class="footnote-ref" href="#fn:gergely">1</a></sup></p>
<p><img alt="该时段内的所有拉取请求。2020年为4000万,2026年为1.1亿" class="newsletter-image" src="https://assets.buttondown.email/images/57660b2f-237a-4c96-8717-ebb00f7b90a6.png?w=960&fit=max" /></p>
<p>如果“spine”不是一种LLM现象,我们预期的增长应仅在1.5倍左右,而不是20倍。另一个可能的混淆因素是,大型语言模型<em>并不</em>喜欢“spine”这个词,而PR Georg向一个脊椎治疗相关的仓库提交了15,000次更改。我将通过忽略这个问题来处理它。</p>
<p>我们能找出具体是哪些模型痴迷于“脊柱”吗?让我们尝试按月份细分变化:</p>
<p><img alt="2026年按月份统计的“脊柱”使用量。从一月到四月每月增长约50%,四月-五月和五月-六月则翻倍" class="newsletter-image" src="https://assets.buttondown.email/images/50980e1b-ae21-43bb-8144-15feea78d543.png?w=960&fit=max" /></p>
<p>查看<a href="https://llmtimeline.org/" target="_blank">LLM时间线</a>,5月发布的唯一广泛使用的模型是Opus 4.8,它在月底才发布,无法解释这次飙升。GPT 5.5在4月发布,这可能是原因。但我并不信服。首先,“脊柱”的计数在四月之前每月仍增长1.5倍,而且我<em>肯定</em>记得早在二月就见过“spine”。另外,我抽查发现,许多使用“spine”的PR是由Claude或Cursor共同编写的。所以我认为这并非特定于某个LLM,不过如果能说服我,我也会改变看法。</p>
<p class="empty-line" style="height:16px; margin:0px !important;"></p>
<h2>其他大型语言模型喜欢的词汇</h2>
<p><a href="https://www.linkedin.com/feed/update/urn:li:activity:7503097291285700609/" target="_blank"><img alt="LinkedIn帖子,内容为'制作一个名为比尔·盖茨的Claude插件,每当Claude说“gate”时就往发誓罐里放一美元。" class="newsletter-image" src="https://assets.buttondown.email/images/8a11547c-4d23-4d71-9447-62b3ebcb2c50.png?w=960&fit=max" /></a></p>
<p><a href="https://graceful.dev/" target="_blank">Avdi</a>没有疯,大型语言模型们确实痴迷于“gate”:</p>
<p><img alt="今年有70万个gate" class="newsletter-image" src="https://assets.buttondown.email/images/2e44c095-35bd-4fd1-970f-878a815e30f2.png?w=960&fit=max" /></p>
<p>顺便说一句,这相当于每300个PR中就有一个。如果我们包含<a href="https://github.com/search?q=created%3A2026-01-01..2026-09-01+gate&type=pullrequests" target="_blank">“gate”出现在任何位置的PR</a>,这个数字会跃升至<strong>每26个PR中有一个</strong>。</p>
<p>我只看标题的原因是,如果我们包含PR正文,在搜索“ladder”时会出现一个伪影。2022年,超过30,000个PR使用了“ladder”这个词。查看<a href="https://github.com/search?q=created%3A2022-01-01..2023-01-01+ladder&type=pullrequests&p=100" target="_blank">一个样本</a>,几乎全部都是由于boto3的自动升级,其升级描述中包含“ABR package ladders”。发现这一点时我感觉很棒,直到出于好奇,我让一个全新环境的LLM“找出飙升的原因”。它更快地得出了相同的答案😢</p>
<p>总之,仅查看PR标题可以消除“ladder”的伪影:</p>
<p><img alt="与2025年相比增长了10倍" class="newsletter-image" src="https://assets.buttondown.email/images/e9e9947e-b451-4b69-b9d2-8cd1c5b94212.png?w=960&fit=max" /></p>
<p>我本想开个“LLM爱梯子”的玩笑,但后来发现我记错了,那个梗是“我爱灯”。我查了查,它们对“灯”的喜爱并不超过普通开发者。</p>
<p>不过,它们确实喜欢“lane”:</p>
<p><img alt="‘lane’的使用量比2025年增长了30倍" class="newsletter-image" src="https://assets.buttondown.email/images/d00af4ab-1158-4842-a154-c7623736cd4e.png?w=960&fit=max" /></p>
<p>也许这可以用“CPU lanes(通道)”来解释?我不知道。</p>
<p>由于形式化验证是AI中的热门话题,我们当然看到更多讨论“proof(证明)”的PR:</p>
<p><img alt="‘仅仅’增长了8倍" class="newsletter-image" src="https://assets.buttondown.email/images/6f8a38bc-aef2-4d6d-ae56-ecf88e018057.png?w=960&fit=max" /></p>
<p>这个增幅没那么大,可能是因为我们已经有“proof of work(工作量证明)”了。而<em>大幅</em>增长的是“truth(真理)”:</p>
<p><img alt="‘truth’的使用量增长了15倍" class="newsletter-image" src="https://assets.buttondown.email/images/cafbc4d2-e06a-4c03-a452-765210da8b60.png?w=960&fit=max" /></p>
<p>最后,在我写这篇文章时,一位同事提到她看到“seam”这个词的频率高得多,所以我也检查了一下:</p>
<p><img alt="另一个使用量增长20倍的词" class="newsletter-image" src="https://assets.buttondown.email/images/6ce0395d-519f-4623-a489-0889665c8120.png?w=960&fit=max" /></p>
<p>我认为,假以时日并采用更复杂的方法,应该能够找出哪些词是特定于某些大型语言模型的。不过,我没那么复杂!</p>
<p><a href="https://gist.github.com/hwayne/ab2dce96bbb02b64c994295079fb8b7f" target="_blank">我把我“凭感觉编码”(vibecoded)出来做这个分析的工具放到了一个gist上</a>。去告诉我,我因为制作可复现的数据集有多酷,或者因为我犯了一个明显错误而搞砸了一切。</p>
<hr />
<h1>分布式系统大会演讲直播观看</h1>
<p>我的<a href="https://systemsdistributed.com/" target="_blank">分布式系统大会</a>演讲<em>《程序员的逻辑》</em><a href="https://www.youtube.com/watch?v=8Xrvyu5tV28" target="_blank">将于9月23日上线</a>!直播期间我会进行实时聊天,回答观众提问,并分享一些制作背景笔记。预计开始时间是中部时间上午11点/东部时间中午。</p>
<div class="footnote">
<hr />
<ol>
<li id="fn:gergely">
<p><a href="https://www.pragmaticengineer.com/" target="_blank">Gergely Orosz</a>拥有<a href="https://www.linkedin.com/posts/gergelyorosz_fresh-data-from-github-agent-generated-prs-activity-7505982106716655617-usGb?utm_source=share&utm_medium=member_desktop&rcm=ACoAAAy9lsoBQ05guk4kYdAe7n5jvTHpOGg-Kgo" target="_blank">内部数据</a>显示,GitHub今年由LLM生成的PR比去年多了7170万。我相信这</p>
</li>
</ol>
</div>
查看缓存全文
缓存时间: 2026/09/17 02:23
# 大模型对"脊梁"情有独钟
来源:https://buttondown.com/hillelwayne/archive/the-llms-yearn-for-the-spines
今年早些时候,我参与了几个由AI生成的TLA+规范项目,注意到它们都用到了"spine"(脊梁)这个词。后来我发现一些非TLA+的公共项目也使用了"spine",这让我好奇这是否是新的LLM语言现象(LLM语言现象?)。
如果是的话,我们应该能看到使用"spine"的代码项目数量出现断层式增长。彻底探究此现象的合适方式本应是通过GitHub存档(https://www.gharchive.org/)的数据转储,但这会耗费大量时间,而我目前全职工作。因此,我改用GitHub搜索(https://buttondown.com/hillelwayne/archive/github-search-for-research-and-learning/)。我们虽无法按日期筛选代码片段,但可筛选拉取请求,这似乎是可行的替代方案。
以下是每年标题中含"spine"的公开拉取请求数量统计图:
一张柱状图,展示了每年标题含"spine"的拉取请求数量,从2020年(低于一千)到2026年9月1日(超过17,000)
我将2026年的数据截至9月1日,这意味着今年前九个月的"spine"拉取请求数量是整个2025年的20倍。当然,GitHub在上一年*可能*大幅增长,也许20倍的增长是由于拉取请求总量增加了20倍。我们可以通过将其与*所有公开拉取请求*(https://github.com/search?q=created%3A2026-01-01..2026-09-01&type=pullrequests)进行比较来校准这一因素:
(参考1: https://buttondown.com/hillelwayne/archive/the-llms-yearn-for-the-spines#fn:gergely)
该时段内所有拉取请求:2020年4000万,2026年1.1亿。
若"spine"不是LLM语言现象,我们预期其从2025年起仅有约1.5倍的增长,而非20倍。另一个可能的干扰因素是,LLM*并不*喜欢"spine"这个词,但PR Georg向一个脊椎指压治疗仓库提交了15,000次更改。对此问题,我将选择忽略。
我们能否找出具体哪些模型特别钟情于"脊梁"?让我们按月份拆分数据看看:
2026年各月"脊梁"使用量。从1月到4月每月增长约50%,4月至5月和5月至6月翻倍。
参考LLM时间线(https://llmtimeline.org/),5月份发布的唯一广泛使用的模型是Opus 4.8,但该模型发布于月底,无法解释激增现象。GPT 5.5发布于4月,可能是诱因。但我对此并不确信。首先,4月之前"脊梁"使用量每月就已增长1.5倍,而且我*清楚记得*早在2月就见过使用"spine"的案例。另外,我抽查发现许多使用"spine"的拉取请求由Claude或Cursor共同完成。因此,我认为这不是某个特定LLM独有的现象,不过我也愿意接受不同观点。
## 大模型偏爱的其他词汇
领英帖子称:"制作一个名为比尔·盖茨的Claude插件,每次Claude说'盖茨'时就往罚款罐里放一美元。"(https://www.linkedin.com/feed/update/urn:li:activity:7503097291285700609/)
Avdi(https://graceful.dev/)没疯,大模型确实对"门控"(gate)痴迷:
今年出现了700,000次"门控"
顺便说一下,这相当于每300个拉取请求中就有一个。如果我们将"gate"出现在*任何位置*的拉取请求(https://github.com/search?q=created%3A2026-01-01..2026-09-01+gate&type=pullrequests)都包含在内,该数字会跃升至**每26个拉取请求中就有一个**。
我只关注标题的原因是,如果包含拉取请求正文,在搜索"ladder"(梯子)时会出现异常。2022年,超过30,000个拉取请求使用了"ladder"一词。查看样本(https://github.com/search?q=created%3A2022-01-01..2023-01-01+ladder&type=pullrequests&p=100)后发现,这几乎是由于boto3的自动升级造成的,其升级描述中包含"ABR package ladders"。发现这点时我挺得意的,但出于好奇,我让一个新训练的LLM"分析激增原因",它更快得出了相同结论 😢
总之,只看拉取请求标题消除了"ladder"的异常数据:
相比2025年增长了10倍
我本想开个"大模型爱梯子"的玩笑,但发现记错了,其实是"我爱灯具"的梗。我查了一下,它们对"灯"(lamp)的偏爱并不超过普通开发者。
不过,它们确实钟爱"车道"(lane):
"车道"相比2025年增长了30倍
这或许能用"CPU车道"(CPU lanes)来解释?我不确定。
由于形式化验证是AI的热门话题,我们自然看到更多讨论"证明"(proofs)的拉取请求:
仅增长了8倍
这个增幅不算太大,可能是因为我们已有"工作量证明"(proof of work)。而"真值"(truth)的增长*确实*显著:
"真值"增长了15倍
最后,我写这篇文章时,一位同事提到她更频繁地看到"seam"(接缝)这个词,于是我也查了一下:
又一个增长20倍的词汇
我认为只要投入更多时间和进行更精细的分析,应该能找出哪些词汇是特定LLM偏好的。不过,我还没那么精细!
我用vibe编码制作的分析工具已作为代码片段发布(https://gist.github.com/hwayne/ab2dce96bbb02b64c994295079fb8b7f)。欢迎来告诉我,我构建可复现数据集有多酷,或者指出我因显而易见的错误搞砸了一切!
---
## 系统分布式讲座实时观看
我的系统分布式(https://systemsdistributed.com/)讲座《程序员的逻辑》将于9月23日(https://www.youtube.com/watch?v=8Xrvyu5tV28)直播!直播时我将进行实时聊天,回答观众提问,并分享制作背景笔记。预计美国中部时间上午11点/东部时间中午12点开始。
相似文章
为了内容而内容
作者探讨了LLM如何影响编码和日常语言中的用词,发现LLM偏好的词汇在编程会话和Google Trends中出现的频率均有所增加,这引发了人们对人类开始采用LLM写作风格的担忧。
LLMs陷入了群体思维的窠臼。这家初创公司正试图让它们摆脱困境。
一家名为Springboards的初创公司开发了一款名为Flint的LLM,旨在生成比主流模型更多样化和更具创意的回答,以解决AI输出中普遍存在的同质化问题。文章强调了相关研究,表明许多LLM因为训练数据和方法相似而趋同于类似的答案。
本地LLM伙伴
一位拥有45年经验的开发者正在构建一个本地优先的LLM框架,包含多智能体逻辑,即将在GitHub上开源,并向社区询问哪些功能能改善他们的本地LLM体验。
@msimoni:在当今的说法中,当编写负载关键代码时,你对LLM施加了多少控制?
一条推文思考开发者在编写关键代码时对LLM的控制程度,提出了从“随性”到精心设计的尺度。
LLM的有效用例
本文分享了LLM在软件工程中的实际应用案例,包括通过RAG搜索客户对话、从日志中排查API故障以及内容精简。重点强调了效率提升和减少手动筛选工作。