首页
/
模型
/
一家初创公司声称突破了限制大语言模型的瓶颈
一家初创公司声称突破了限制大语言模型的瓶颈
摘要
总部位于迈阿密的初创公司 Subquadratic 声称其新模型 SubQ 解决了二次注意力瓶颈问题,使大语言模型更快、更便宜。Appen 的独立测试证实了其中许多说法,但质疑依然存在。
<div data-chronoton-summary="<ul><br><li><strong>一家初创公司宣称破解了困扰 AI 领域十年的瓶颈:</strong>总部位于迈阿密的 Subquadratic 表示,其新模型 SubQ 解决了导致大语言模型缓慢且昂贵的计算问题。许多人持怀疑态度,但该公司现在引入了外部验证机构来支持其大胆的主张。</li><br><li><strong>突破背后的数学原理:</strong>大多数大语言模型会将文档中的每个词与其他所有词相乘,导致文本越长,成本呈爆炸式增长。SubQ 采用“稀疏注意力”机制,跳过不必要的比较——这个简单的想法许多人尝试过,但未能使其在竞争水平上发挥作用。</li><br><li><strong>独立测试前景看好,但问题依然存在:</strong>第三方公司 Appen 发现 SubQ 的运行速度比同类方法快 56 倍,在一项关键的长文档检索测试中得分 98%。不过,该模型尚未广泛可用,批评者指出它是在借用现有中国开源模型权重的基础上构建的。</li><br></ul>" data-chronoton-post-id="1139313" data-chronoton-expand-collapse="1" data-chronoton-analytics-enabled="1"></div>
<p>总部位于迈阿密的 AI 初创公司 Subquadratic 上月结束隐身模式,并发布了一项重大声明。该公司宣布已<a href="https://subq.ai/introducing-subq">解决了一个数学瓶颈</a>,该瓶颈已困扰大语言模型近十年。</p>
<p>起初细节很少,许多人并不信服。但 Subquadratic 已开始拿出证据,分享了其新技术的独立评估结果。这些结果表明,该公司的说法或许值得关注。</p>
<p>据 Subquadratic 称,他们开发了一种名为 SubQ 的新型大语言模型,比市场上任何其他模型都更快、更便宜,能耗更低。该公司还声称,SubQ 一次能处理的文本量是大多数其他模型的 12 倍,从而能够执行大量数据密集型任务,例如分析数百份文档或整个代码库。</p>
<p>此外,Subquadratic 表示,SubQ 在关键任务(如编程)上的性能与 Google DeepMind、OpenAI 和 Anthropic 发布的最佳模型几乎持平。</p>
<p>问题在于,该公司最初仅提供了少数自己发布的测试分数作为证据,且尚未广泛开放 SubQ 供用户自行试用。</p>
<p>因此,Subquadratic 的说法遭到怀疑并不意外。人工智能工程师 Dan McAteer 在 X 平台上<a href="https://x.com/daniel_mac8/status/2051710659822305661">总结了大家的反应</a>:“SubQ 要么是 Transformer 以来最大的突破……要么就是 AI 界的 Theranos。”</p>
<p>一个月后,该公司发布了<a href="https://subq.ai/docs/subq-1-1-small-model-card.pdf">更多关于其模型的信息</a>,包括由第三方公司 Appen 进行的<a href="https://www.appen.com/whitepapers/subquadratic-preview-model-benchmark-evaluation">额外独立测试</a>结果。</p>
<p>“我们预料到了合理的怀疑,”Subquadratic 联合创始人兼首席技术官 Alex Whedon 表示。“事后看来,如果在最初发布时就同时公开第三方基准测试,或许能预先打消很多怀疑。这也是为什么我们要花时间确保未来的任何结果在发布前都经过充分验证。”</p>
<p>Subquadratic 委托评估其他公司模型的 Appen 对 SubQ 进行测试。结果似乎支持了 Subquadratic 的许多主张。“这让我非常兴奋,它验证了他们的架构,”Appen 生成式 AI 研究总监 Jeanine Sinanan-Singh 说道。</p>
<p>“我当时想,‘哇,这可能会改变游戏规则’,因为模型在速度低效方面存在问题,”她补充道。“但当你有令人震惊的结果时,如果由你自己说出来,可信度确实不高。”</p>
<p>SubQ 不会全面取代现有的顶级模型,但在某些任务上,它可能以标准成本的一小部分提供巨大的速度提升。不过,Subquadratic 坚称,从长远来看,其突破可能会改变大语言模型的构建方式。“我们希望开创一个高效的新时代,”该公司联合创始人兼首席执行官 Justin Dangel 表示。“我们认为几年内没人会再基于 Transformer 进行构建。”</p>
<h3 class="wp-block-heading"><strong>注意力!</strong></h3>
<p>要理解 Subquadratic 的主张为何重要,我们需深入了解大多数大语言模型的工作原理。大语言模型内部的关键机制是一种名为 Transformer 的神经网络,它运行一种称为密集注意力的过程。如今的大语言模型通常将多个 Transformer 串联在一起。(大语言模型时代的奠基论文由 Google 研究人员于 2017 年发表,标题为<a href="https://arxiv.org/abs/1706.03762">《注意力就是你所需要的一切》</a>。)</p>
<p>密集注意力的工作原理如下:当 Transformer <a href="https://www.technologyreview.com/2026/01/07/1130795/what-even-is-a-parameter/">处理一段文本</a>时,它首先将每个词(或词的一部分,称为 token)编码为一个数字。为了捕捉全文的含义,它随后将这些数字中的每一个与该文本的其他所有数字相乘。例如,一段 10,000 词的文本会引发近 5000 万次单独的乘法运算。这需要大量计算,也是大语言模型以高能耗著称的主要原因。</p>
<p>“如果你想总结《了不起的盖茨比》,你必须同时查看第一个词和最后一个词,然后还必须查看所有其他组合,”Dangel 说道。</p>
<p>随着文本长度增加,计算次数呈指数级增长。这是因为每个新增数字都必须与之前所有数字相乘。单词数量翻倍,计算次数大约翻两番,这种增长率称为二次扩展。</p>
<p>(你可以这样想象:画一个圆圈,在边缘标出点。每个点代表一个 token。然后在点对之间画线,表示这两个 token 的乘法。五个点的圆将有 10 条交叉线。增加到 10 个点,你将得到 45 条线;20 个点,190 条线,以此类推。)</p>
<h3 class="wp-block-heading"><strong>削减成本</strong></h3>
<p>Subquadratic 的解决方案是放弃密集注意力——Transformer 的核心操作——转而采用所谓的稀疏注意力,这大大减少了所需的计算次数。稀疏注意力不是将每个 token 的数字与其他所有数字相乘,而是只选择部分数字进行相乘。其思想是,文本中并非所有词与词之间的关系都重要。</p>
<p>“稀疏注意力认为并非所有这些关系都重要,因为它们确实不重要,”Whedon 说道。“如果你在读一本书,你不会去看第一个词和第二个词、第一个和第三个——那太疯狂了。”</p>
<p>这是一种简单的方法,Subquadratic 并非第一个尝试的。“几乎所有能想到的方法都有人尝试过,”曾在 OpenAI 工作过的独立 AI 研究员 Will Depue 表示。“并非不可能,但这就像跑四分钟一英里一样难。”</p>
<p>以往选择哪些数字相乘、哪些忽略的技术,未能产生一种能像密集注意力一样捕捉文档含义的机制。</p>
<p>Subquadratic 声称终于解决了这个问题。它将 SubQ 定位为第一个在性能上与主流密集注意力模型相媲美的稀疏注意力大语言模型。</p>
<p>“从历史上看,大多数机制都使用了固定
查看缓存全文
缓存时间:
2026/06/20 14:36
# 一家初创公司声称突破了大语言模型的瓶颈
来源:https://www.technologyreview.com/2026/06/19/1139313/a-startup-claims-it-broke-through-a-bottleneck-thats-holding-back-llms
Subquadratic 现已分享了其新模型的更多细节。但仍有人持怀疑态度。
一只猎豹向右冲出画面,左侧是注意力网格的方格在逼近。
Stephanie Arnett/《麻省理工科技评论》 | Adobe Stock
总部位于迈阿密的 AI 初创公司 Subquadratic 上个月结束了隐身模式,并宣称取得了重大突破。它宣布解决了(https://subq.ai/introducing-subq)近十年来一直制约大语言模型的一个数学瓶颈。
当时细节匮乏,许多人并不信服。但 Subquadratic 开始拿出证据,分享了其新技术的独立评估结果。这些结果表明,该公司的说法或许值得关注。
据 Subquadratic 称,它开发了一种名为 SubQ 的新型大语言模型,该模型比市场上任何其他模型更快、更便宜,且能耗更低。该公司还声称 SubQ 一次能处理的文本量多数其他模型的多达 12 倍,使其能够处理一系列数据密集型任务,例如分析数百份文档或整个代码库。
更重要的是,Subquadratic 表示,在代码等关键任务上,SubQ 的性能与 Google DeepMind、OpenAI 和 Anthropic 推出的最佳模型基本持平。
问题在于,该公司最初只提供了少量自行发布的测试分数作为证据。而且它尚未让 SubQ 广泛开放供人们自行试用。
因此,Subquadratic 的说法招致怀疑也就不足为奇了。AI 工程师 Dan McAteer 在 X 平台上总结了普遍反应(https://x.com/daniel_mac8/status/2051710659822305661):“SubQ 要么是自 Transformer 以来最大的突破……要么就是 AI 界的 Theranos。”
一个月后,该公司发布了关于其模型的更多信息(https://subq.ai/docs/subq-1-1-small-model-card.pdf),包括第三方公司 Appen 进行的额外独立测试结果(https://www.appen.com/whitepapers/subquadratic-preview-model-benchmark-evaluation)。
“我们预料到会有合理的怀疑,”Subquadratic 联合创始人兼首席技术官 Alex Whedon 说。“事后看来,如果在最初发布时就同时公布第三方基准测试,本可以消除很多怀疑,这就是为什么我们现在要花时间确保任何未来的结果在发布前都经过完全验证。”
Subquadratic 委托评估其他公司模型的 Appen 在 SubQ 上运行其测试。结果似乎证实了 Subquadratic 的许多说法。“这让我非常兴奋,它验证了他们的架构,”Appen 的生成式 AI 研究总监 Jeanine Sinanan-Singh 说。
“我当时想,‘哇,这可能会改变游戏规则,’因为模型在速度和低效率上存在困难,”她补充道。“但当你有这种令人震惊的结果时,由你自己说出来就不那么可信了。”
SubQ 不会全面取代现有的顶级模型,但在某些任务上,它可以以典型成本的一小部分提供巨大的速度提升。不过,Subquadratic 坚称,从长远来看,其突破可能会改变大语言模型的构建方式。“我们希望能开启一个高效的新时代,”该公司联合创始人兼 CEO Justin Dangel 说。“我们认为几年内不会再有人在 Transformer 基础上进行构建。”
### **注意力!**
为了理解为什么 Subquadratic 的说法如此重要,让我们深入了解一下大多数大语言模型的工作原理。大语言模型内部的关键机制是一种称为 Transformer 的神经网络,它运行着一个被称为密集注意力的过程。今天的大语言模型通常将多个 Transformer 串联在一起。(开启大语言模型时代的基础论文,由谷歌研究人员于 2017 年发表,标题为“注意力就是你所需要的一切”(https://arxiv.org/abs/1706.03762)。)
密集注意力是这样工作的:当 Transformer 处理一段文本时(https://www.technologyreview.com/2026/01/07/1130795/what-even-is-a-parameter/),它首先为每个单词(或单词的一部分,称为 token)编码一个数字。然后,为了捕捉全文的意义,它将每个数字与该文本中的每一个其他数字相乘。例如,一段 10000 个单词的文本将启动近 5000 万次单独的乘法运算。这是大量的计算,也是大语言模型以高能耗闻名的首要原因。
“如果你想概括《了不起的盖茨比》,你必须同时查看第一个词和最后一个词,然后你还必须查看所有其他组合,”Dangel 说。
随着文本长度的增加,计算次数激增。这是因为每一个新增的数字都必须与之前的所有数字相乘。单词数量翻倍,计算次数大约翻两番,这种增长率被称为二次扩展。
(你可以自己想象:画一个圆,在边缘标上点。每个点就是一个 token。然后在点对之间画线,代表这两个 token 的乘法。五个点的圆会有 10 条线穿过。变成 10 个点,你将得到 45 条线,20 个点则有 190 条线,以此类推。)
### **大幅削减成本**
Subquadratic 的解决方案是放弃 Transformer 的核心操作——密集注意力,转而采用所谓的稀疏注意力,这大幅削减了所需的计算次数。稀疏注意力不是将每个 token 对应的数字与所有其他数字相乘,而是只选择部分数字进行相乘。其思路是,文本中并非所有单词之间的关系都重要。
“稀疏注意力认为并不是所有这些关系都重要,因为事实就是如此,”Whedon 说。“如果你在读书,你不会去看第一个词和第二个词、第一个和第三个——这太疯狂了。”
这是一种简单的方法,Subquadratic 并非首创。“几乎能想到的方法都有人尝试过,”曾在 OpenAI 工作的独立 AI 研究员 Will Depue 说。“并非不可能,但类似于跑一英里四分钟。”
以往选择哪些数字相乘、哪些忽略的技术,没有产生出能像密集注意力一样好地捕捉文档含义的机制。
Subquadratic 声称终于解决了这个问题。它将 SubQ 定位为第一个在性能上与主流密集注意力模型相媲美的稀疏注意力大语言模型。
“从历史上看,大多数机制使用固定模式,比如总是将第一个词与第五个词进行比较,”Whedon 说。“这非常有限。语言远比这复杂。因此,我们机制的一个独特之处在于,我们动态地选择哪些关系是重要的。”
该公司不会透露 SubQ 具体如何选择要关注的单词,但这种选择是即时计算出来的,并且对所给的每段文本都不同。“这有点像我们的秘制配方,”Whedon 说。
### 测试,测试
结果是,对于某些任务,SubQ 可能比大多数其他模型运行得更快、更便宜。Appen 在一系列标准测试中对 SubQ 进行了评估。在一个直接的纯速度测试中(该测试设定模型理论上能运行多快的基准线,而非评估模型实际能做什么),Appen 发现 SubQ 比使用之前稀疏注意力技术 FlashAttention 的模型快 56 倍。
在 LiveCodeBench(一个测试模型在真实竞赛编程问题中表现如何的测试)上,SubQ 得分 89.7%,与其他顶级编码模型处于同一水平(https://livecodebench.github.io/leaderboard.html)。“这个模型在编码方面继续提供前沿水平的性能,”Appen 的 Sinanan-Singh 说。
Subquadratic 关于成本的声明更难验证,因为 SubQ 尚未广泛可用。据 Dangel 称,在 RULER 128(Nvidia 开发的评估模型从大数据集中检索信息能力的测试)上运行 Anthropic 的 LLM Opus 4.6 需要花费 2600 美元。而 SubQ 呢?“花了我们八美元,”他说。
SubQ 似乎确实能够处理非常大的数据集。该模型的上下文窗口(大致相当于工作记忆)最长可达 1200 万个 token。如今大多数顶级模型的上下文窗口是 100 万个 token。在 Whedon 为我演示的一个示例中,他让 SubQ 执行一项需要推理包含在 400 份文档中信息的任务。它在几秒内就做出了回应。当他给流行的 LLM 驱动的搜索引擎 Perplexity 同样的任务时,它未能成功加载全部 400 份文档。
Appen 还运行了“大海捞针”测试,该测试评估模型从大量数据中检索特定信息的能力。在报告中,Appen 指出 SubQ 在 600 万和 1200 万 token 的上下文窗口下得分 98%(https://www.appen.com/whitepapers/subquadratic-preview-model-benchmark-evaluation),“在极少模型测试过的大规模下保持了近乎完美的长上下文检索能力。”
### **好得令人难以置信?**
尽管分数很高,但基准测试并不能完整描绘一个模型能做什么和不能做什么。在非常特定的条件下进行测试,并不能替代在广泛真实任务上运行模型。
Subquadratic 将 SubQ 定位为专为编码和搜索超大数据集而设计的模型。它表示已有数万名潜在用户注册了早期访问,其中包括超过 500 家企业客户。但等待名单很长,该公司迄今为止只让极少数人获得访问权限。Subquadratic 回应称,它是一家资源有限的新兴小公司,无法同时服务太多人。
在更多人能拿到模型并亲自试用之前,一些怀疑是有道理的。一个令人困扰的问题是,Subquadratic 复用了中国开源模型 Qwen 某个版本的权重(训练时在模型中设定的值,决定了模型的行为方式(https://www.technologyreview.com/2026/01/07/1130795/what-even-is-a-parameter/))来引导 SubQ,而不是从头开始训练。这是模型制造商常见做法,但与 Subquadratic 声称的已彻底重新发明大语言模型工作方式相矛盾。
“他们可能构建了真正有用的东西,”Depue 说。“但公开的证据尚不足以证明他们已解决了二次注意力瓶颈这一更大的论断。”
与此同时,Subquadratic 联合创始人 Whedon 坚称,做出与众不同的东西是他的唯一选择。如果你想构建一个有竞争力的模型,就必须有新想法,他说:“我们比 OpenAI 面临更严峻的局面。”
### 深度解读
### 人工智能
### 保持联系
插图:Rose Wong
## 获取来自《麻省理工科技评论》的最新更新
发现特别优惠、头条新闻、即将举行的活动等更多信息。
相似文章
MIT Technology Review
MIT Technology Review reports on a wave of startups pursuing post-transformer architectures for LLMs, as the dominant model family faces growing costs, energy use, and context-length limits. Companies like Subquadratic aim to build the next generation of AI.
Reddit r/LocalLLaMA
一位智能手机电池评测员使用两个本地 LLM(Qwen3.6 模型),运行在高端 NVIDIA GPU 上,驱动一个视觉语言智能体,自主控制机械臂进行逼真的电池耗电测试,实现了低于两秒的延迟。
X AI KOLs Timeline
一位前vLLM核心贡献者解释了如何通过LMCache将KV缓存卸载到CPU/SSD/远程存储,从而使LLM推理成本降低10倍,这一技术已被彭博等生产环境采用。
Reddit r/MachineLearning
Sebastian Raschka回顾了LLM架构中针对长上下文效率的最新创新,包括KV共享、压缩卷积注意力和来自Gemma 4、ZAYA1、Laguna XS.2和DeepSeek V4等模型的逐层注意力预算。
Reddit r/singularity
Subquadratic AI 推出 SubQ-1.1-Small,该模型利用 Smart Sparse Attention 在长达 1200 万 token 的上下文中实现近乎完美的长上下文检索,注意力计算量减少高达 1000 倍。它兼顾了长上下文优化与强大的通用推理能力,在 NIAH 和 RULER 等基准测试中优于基线模型。