2026年的大语言模型(截至目前)
摘要
Simon Willison在WeAreDevelopers World Congress North America的主题演讲总结了2026年大语言模型的关键发展,包括可靠的编程智能体的兴起,以及像Claude Opus 4.5和GPT-5.1这样的模型发布。
暂无内容
查看缓存全文
缓存时间: 2026/09/28 03:58
# 2026年的大语言模型(至今)
来源:https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/
2026年9月27日
上周五,我在圣何塞举行的WeAreDevelopers全球开发者大会北美站(https://www.wearedevelopers.com/world-congress-north-america)上发表了闭幕主题演讲。我将过去一年的关键趋势串联起来,按时间顺序梳理了2026年发生的一切。
视频已发布在YouTube(https://www.youtube.com/watch?v=GAkIytR7vcc);以下是我的演讲配套注释和幻灯片。
## 2026年的大语言模型(至今)
Simon Willison
WeAreDevelopers全球开发者大会北美站,2026年9月25日
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.001.webp)
我将快速回顾2026年至今发生的所有事情。这一年还没结束呢!
## 2025年11月
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.002.webp)
对我而言,2026年实际上始于2025年11月,提前了几个月。
### 2025年11月的转折点
**Claude Opus 4.5** 和 **GPT-5.1**
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.003.webp)
11月,两个重要模型发布:**Claude Opus 4.5** 和 **GPT-5.1**。
如同以往新模型发布一样,它们是对前代模型的渐进式改进。但偶尔,当模型的改进跨过一条无形的界限时,一些原本无法实现的功能开始变得可用。
这次,变得可用的功能是它们的**编程代理**。
**Claude Code** 自2025年2月就已出现,**Codex** 稍晚一些。这两个新模型,当与各自的编程代理工具结合时,从“经常出错”提升到了“可靠到足以日常使用”的水平。
> “生成一张鹈鹕骑自行车的SVG图”。
> Claude Opus 4.5生成的自行车车架形状非常怪异,鹈鹕看起来像只鸭子。GPT-5.1生成的稍好,但车架依然有问题,鹈鹕喙也稍好,但两者都很糟糕。
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.004.webp)
几年来,我一直通过让模型“生成一张鹈鹕骑自行车的SVG图”来评估新模型。
这大概是世界上最愚蠢的基准测试——从中能学到的东西有限。但它对模型来说仍然是个挑战,因为画鹈鹕很难,画自行车也很难,而且鹈鹕本来就骑不了自行车。
以下是2025年11月的水平。Claude仍然画不好自行车!GPT-5.1的车架也很糟糕。
2025年11月24日 - steipete/Warelay仓库的第一次提交。一个添加MIT许可文件的GitHub提交。
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.005.webp)
同样在11月,一个名为“Warelay”的冷门GitHub仓库有了第一次提交。我们稍后会再回到这个仓库。
## 1月
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.006.webp)
接着是12月的假期,个别开发者休了假,许多人开始折腾这些新的编程代理模型组合……我们逐渐意识到,它们能做到的事情比以前多得多。
到了1月,我们很多人都非常兴奋,准备开始将这些技术投入实践。
### 2026年新年决心
以往每一年:少接新项目,专注于现有项目中最重要的事情
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.007.webp)
我每年都会设定新年决心,在我的记忆里,内容总是一样的:保持专注。少接新项目。努力完成已有的项目。
**2026年:更大胆一些。想接多少新项目就接多少。**
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.008.webp)
今年我决定,既然以前那套从未奏效,那就反其道而行之。我们现在有了编程代理,让我们看看它们能做什么。我要想接多少新项目就接多少!
(你可以年底再来问我这是不是个好主意。我现在手头同时进行着*很多*项目呢。)
“更大胆一些”成了今年的一个主题,因为要找到这项技术的极限,唯一的办法就是不断挑战极限,直到它失效为止。
### 2026年预测
- 大语言模型能写出好代码这一点将变得无可辩驳
- 我们最终会解决沙箱安全问题
- 编程代理安全领域会出现一场“挑战者号灾难”
- 喙鹦鹉将迎来出色的繁殖季(全球仅存236只!)
- ……教皇将就大语言模型及其对世界的经济影响发表看法
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.009.webp)
我还和Bryan Cantrill、Adam Leventhal一起上了Oxide and friends播客(https://simonwillison.net/2026/Jan/8/llm-predictions-for-2026/),分享了对未来一年(以及三年和六年)的预测。
事后看来,我的大语言模型预测相当保守。我说“大语言模型能写出好代码这一点将变得无可辩驳”——我认为我们现在已经达到了这个阶段。
我预测我们最终会解决沙箱安全问题。我统计了一下,本次大会(https://www.wearedevelopers.com/world-congress-north-america/agenda/schedule)277场会议中,大约有40场以某种方式涉及了沙箱或代理安全,所以在这个方向上我们至少投入了大量精力!
我预测编程代理安全领域会出现一场“挑战者号灾难”。今年代理安全方面确实有很多讨论,不过我预测的那场具体灾难(编程代理被劫持并造成现实世界的经济损失)并未真正发生。
我们还开了一个玩笑式的预测(https://simonwillison.net/2026/May/25/encyclical-on-ai/#another-2026-prediction-down),说教皇会就大语言模型的经济影响发表看法。
一张美丽绿色新西兰喙鹦鹉的照片。照片来源:Kimberley Collins。
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.010.webp)
我还预测,新西兰的**Kākāpō**(鸮鹦鹉)今年将有一个出色的繁殖季。
这些鸟生活在新西兰。它们是不会飞的夜行性鹦鹉。样子有点笨拙,我觉得它们很美,年初时全球仅存236只。
Kākāpō只在Rimu树大量结果的年份才会繁殖,而上一次大丰收已经是四年前了……但今年Rimu树的果实看起来非常丰硕。
照片:Kimberley Collins(https://commons.wikimedia.org/wiki/File:K%C4%81k%C4%81p%C5%8D_at_Dunedin_Wildlife_Hospital.jpg)。
### Deep Blue
由Adam Leventhal和Bryan Cantrill提出
一种由AI引发的倦怠感,当软件工程师因为AI无所不能而感到无精打采时
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.011.webp)
也是在那次播客上,我们创造了一个术语(完全归功于Adam),用来形容“那种由AI引发的倦怠感,当软件工程师因为AI无所不能而感到无精打采时”。我们称之为**Deep Blue**(https://simonwillison.net/2026/Feb/15/deep-blue/)。
这成了贯穿全年的主题,本次大会上也有几位演讲者提到了它。作为一名软件工程师,我职业生涯中从未有过像今年这样,一切都如此迅速、如此剧烈地改变。我今年做的很多事,就是试图去理解这种变化以及它对我自身职业意味着什么。
### AI狂热
micro-javascript和pwasm GitHub README文件的截图。
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.012.webp)
同样在1月,我患上了我称之为**AI狂热**的毛病。
这和AI精神病(AI psychosis)(https://en.wikipedia.org/wiki/AI-induced_psychosis)不同。
患有AI狂热时,只要你的代理没在为你构建东西,你就会觉得是在浪费时间。你会熬夜,因为你本可以熬夜让代理去做更多事。
我的AI狂热体现在一些极其雄心勃勃的项目上。我完全用Python构建了一个JavaScript解释器(https://github.com/simonw/micro-javascript),其灵感来自Fabrice Bellard的MicroQuickJS(https://github.com/bellard/mquickjs)。然后我又用Python构建了一个WebAssembly运行时(https://github.com/simonw/pwasm)。
这些项目相当有用,因为它们某种程度上治好了我的AI狂热……因为在构建这些东西后,我看着它们问:“世界真的需要一个缓慢、有漏洞、半生不熟的Python JavaScript解释器吗?”我觉得不需要。
![micro-javascript playground 3 在一个由Pyodide驱动的沙盒化micro-javascript环境中执行JavaScript代码
一个包含一些JavaScript代码、一个“Run Code”按钮和输出面板的Web UI。
ELECT var numbers = [1, 2, 3, 4, 5, 6, 7, 8, 9, 10];
var doubled = numbers.map(n => n * 2);
console.log('Doubled:', doubled);
var evens = numbers.filter(n => n % 2 === 0);
console.log('Evens:', evens);
var sum = numbers.reduce((a, b) => a + b, 0);
console.log('Sum:', sum);
输出:
Doubled: [2, 4, 6, 8, 10, 12, 14, 16, 18, 20]
Evens: [2, 4, 6, 8, 10]
执行时间:8.00ms
关于:micro-javascript 是一个纯Python实现的JavaScript解释器,具有可配置的内存和时间限制。此playground完全在您的浏览器中使用Pyodide(编译为WebAssembly的Python)运行。
在GitHub上查看](https://static.simonwillison.net/static/2026/2026-in-llms/simon-willison-2026-in-llms-png.013.webp)
上一张截图,叠加了以下文字:JavaScript 运行在 Python 上,Python 运行在 Pyodide 上,Pyodide 运行在 WebAssembly 上,WebAssembly 运行在 JavaScript 上
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.014.webp)
这个页面运行的是我用Python构建的JavaScript解释器,它运行在Pyodide(https://pyodide.org/)上,Pyodide是编译为WebAssembly的Python,而这又运行在JavaScript上,最终运行在浏览器里。这是一堆美丽的恐怖技术栈。
我今年玩WebAssembly(https://simonwillison.net/tags/webassembly/)玩得很开心。
### Warelay → CLAWDIS → CLAWDBOT → Clawdbot → Moltbot → 🦞 OpenClaw
显示这些名称变更发生日期的截图。
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.015.webp)
到1月底,我们11月看到的那个仓库已经更名,先后改为**CLAWDIS**,然后是**CLAWDBOT**,接着是**Moltbot**,最后定名为**OpenClaw**。
同一截图,叠加文字显示:两个月内提交了8,330次(今天已达到100,141次)
通用术语:Claw
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.017.webp)
这开启了**OpenClaw**革命。它有效地定义了一个新的软件类别。
对于这类软件,有一个我很喜欢的通用术语。我们称这类软件为“**Claw**”。有**OpenClaw**、**NanoClaw**(https://github.com/nanocoai/nanoclaw)、**IronClaw**(https://github.com/nearai/ironclaw)、**PicoClaw**(https://github.com/sipeed/picoclaw)……
今天它们被重新定位为“个人代理”或“通用代理”,但我仍然喜欢把它们想象成**Claw**。
一张Mac mini的照片
你的Claw的水族箱
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.018.webp)
湾区的苹果商店卖光了Mac mini,因为太多人购买Mac mini来运行**OpenClaw**!
Drew Breunig(https://www.dbreunig.com/)说,这是因为你的**OpenClaw**就像一个电子宠物,而你买一个Mac mini就像买了一个水族箱来饲养你的“爪子”,这想法还挺美妙的。
Moltbook截图 - 一个AI代理的社交网络
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.019.webp)
同样在1月,我们有了这个网站。那是**MoltBook**(https://www.moltbook.com/),一个AI代理的社交网络,其理念是让你的**Claw**去和所有其他的**Claw**聊天,因为这样做还能出什么问题呢?
该网站在周四上线。周五就爆火了(https://simonwillison.net/2026/Jan/30/moltbook/)。周一被《纽约时报》报道(https://www.nytimes.com/2026/02/02/technology/moltbook-ai-social-media.html)。到了周二,它就被大量低质内容和垃圾信息淹没,所有人都忘了它的存在。
一个月后,Facebook/Meta收购了它(https://www.cnbc.com/2026/03/10/meta-social-networks-ai-agents-moltbook-acquisition.html)。
## 2月
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.020.webp)
2月,一家名为**StrongDM**的公司介绍了他们的“软件工厂”。
**StrongDM的黑暗工厂**
Justin McCarthy, Jay Taylor, Navan Chauhan
软件工厂与代理时刻
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.021.webp)
他们在《软件工厂与代理时刻》(https://factory.strongdm.ai/)一文中写了相关内容。我去年10月亲眼看过他们的演示,当时也发布了我的笔记(https://simonwillison.net/2026/Feb/7/software-factory/)。
Dan Shapiro将这种方法称为**黑暗工厂**(https://www.danshapiro.com/blog/2026/01/the-five-levels-from-spicy-autocomplete-to-the-software-factory/),其理念是:如果你的工厂足够自动化,你甚至可以关掉灯,因为你不需要看到发生了什么。
StrongDM提出了两条他们自去年7月起就遵循的软件开发规则。
“规则1:代码不得由人编写”
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.022.webp)
第一条规则是:代码**不得由人编写**。你编写的任何代码都必须经过编程代理的流转。这在2月听起来很激进,但我想象在座的许多人今天差不多就在这样生活。
“规则2:代码不得由人审查”(!)
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.023.webp)
第二条规则是:代码**不得由人审查**。你不被允许阅读代码!
这在今年很长一段时间里仍然是一个巨大的话题。本次大会的许多会议都涉及代码审查以及如何做到这一点。
让我对StrongDM感兴趣的是,他们比我们领先了六个月,一直在探索构建软件但不阅读代码、同时仍然确信软件高质量的意义。你能用这些代理做什么来帮助验证它们的工作?
StrongDM是一家安全公司,他们在这个项目上拥有数十年经验的人员。他们非常深入地探索了使用这些技术可能做以及负责任地做的事情的边界。
新西兰环保部网站头条:四年来首只kakapo雏鸟在情人节孵化。它是一个灰色的毛球。
2026年2月19日
**Gemini 3.1 Pro**
一张令人惊讶的鹈鹕骑自行车插图,质量上乘。
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.025.webp)
同样在2月……谷歌发布了**Gemini 3.1 Pro**。
这是一张相当棒的鹈鹕骑自行车的图!链条位置正确,两侧都有脚踏板。篮子里还有一条小鱼。
@JeffDean on Twitter - 一段比较Gemini 3 Pro和Gemini 3.1 Pro的视频。
[](https://simonwillison.net/2026/Sep/27/2026-in-llms-so-far/#simon-willison-2026-in-llms.026.webp)
然后,谷歌的Jeff Dean发了一段视频(https://x.com
相似文章
五分钟回顾LLM最近六个月
Simon Willison在PyCon US 2026上进行了闪电演讲,总结了2025年11月至2026年5月期间LLM的关键进展,包括Anthropic、OpenAI和Google之间五方争夺最佳模型,以及编码代理实现可靠代码生成的突破。
开源LLM现状(2026年8月31日)
本文概述了截至2026年8月31日开源大语言模型的发展和现状。
LLM编码时代的软件工程最佳实践
一篇讨论软件工程最佳实践如何随着LLM编码工具的整合而发展的文章,为开发者提供指导。
@bibryam: 我作为高级工程师在2026年如何使用LLMs https://seangoedecke.com/how-i-use-llms-in-2026… 最大的AI工作流变化…
一位高级工程师描述了到2026年LLM代理如何演变成编码、调试和代码库研究的可靠协作者,而人类仍负责判断和审查。
These startups are chasing the next big thing in LLMs
MIT Technology Review reports on a wave of startups pursuing post-transformer architectures for LLMs, as the dominant model family faces growing costs, energy use, and context-length limits. Companies like Subquadratic aim to build the next generation of AI.