PrismML希望其微型LLM将改变我们使用AI的方式

TechCrunch AI 模型

摘要

PrismML,一家由Caltech创立的初创公司,发布了Bonsai 2,这是一个高度压缩的LLM,将内存使用量减少9-10倍,性能损失极小,旨在使AI能够在PC和智能手机等消费设备上运行。

如果AI实验室PrismML还不在你的关注范围内,那它应该被关注。
查看原文
查看缓存全文

缓存时间: 2026/09/18 00:12

# PrismML希望其微型大语言模型能改变我们使用AI的方式 | TechCrunch 来源:https://techcrunch.com/2026/09/17/prismml-hopes-its-tiny-llm-could-change-how-we-all-use-ai/ 如果AI实验室PrismML (https://prismml.com/) 尚未进入你的视野,那么它值得关注——并非因为它已筹集巨额资金(尚未实现,目前仅完成2225万美元的种子轮融资),而是因为其背后的技术人才以及它正在开发的可能改变行业格局的技术。 PrismML押注于这样一个方向:具备能力、高性能且具备推理能力的大语言模型,实际上并不必然需要庞大的体积。 该公司正在开发能够小型化到足以在个人电脑和智能手机上运行的推理模型。(有传言称其正与Apple (https://www.cnbc.com/2026/07/14/apple-prismml-ai-compression-iphone.html) 展开洽谈,但首席执行官Babak Hassibi拒绝对此向TechCrunch发表评论。) 周四,PrismML发布了其系列模型中的最新成员——Bonsai 2 27B (https://prismml.com/news/bonsai-2-27b),该模型将阿里巴巴广泛使用的开源模型Qwen3.8 27B压缩至5.9 GB。这个尺寸足以在个人电脑乃至高端智能手机上运行。与原始模型相比,内存占用减少了9到10倍。 PrismML由一群加州理工学院的研究人员创立,并由该校教授、压缩技术专家Hassibi领导。该初创公司还聘请了Ion Stoica担任顾问。Stoica是Databricks(以及其他多家公司)的联合创始人,也是加州大学伯克利分校著名的Sky Computing实验室的主任,该实验室孕育了众多技术和初创公司,从Letta (https://techcrunch.com/2024/09/23/letta-one-of-uc-berkeleys-most-anticipated-ai-startups-has-just-come-out-of-stealth/) 到SGLang (https://techcrunch.com/2026/01/21/sources-project-sglang-spins-out-as-radixark-with-400m-valuation-as-inference-market-explodes/)。 PrismML还获得了Khosla Ventures、Cerberus Capital以及加州理工学院的投资支持。 这家初创公司当然并非唯一一家致力于大语言模型压缩技术的公司。另一家是Multiverse Computing,由西班牙多诺斯蒂亚国际物理中心的知名教授创立。(而且Multiverse Computing也已筹集到巨额资金 (https://techcrunch.com/2026/03/19/multiverse-computing-pushes-its-compressed-ai-models-into-the-mainstream/)。) 但Hassibi表示,PrismML的压缩技术之所以独特,是因为其压缩后的大语言模型相比原始模型几乎没有任何性能损失。Bonsai 2的综合基准测试得分达到了Qwen模型的98%。这高于今年3月发布的第一代Bonsai模型,后者达到了95%。该公司表示,第一代模型已被下载超过1100万次,而PrismML更小尺寸的模型则额外获得了260万次的下载量。 这表明PrismML的压缩成果在每次发布中都在不断改进。它最终能否达到100%的基准性能对等仍是未知数。Hassibi说,压缩总会带来一些影响。 话虽如此,完美的基准性能对等在某种程度上是偏学术性的。未经压缩的大语言模型本身也并非绝对精确,基准测试也不能完全反映实际任务,因此2%的性能下降可能不会对模型的实际使用表现产生实质性影响。(此外,模型运行所在的框架——这个“外围软件”——对准确性同样至关重要 (https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/)。) PrismML表示,其实现这一成果的方式是压缩构成模型的“权重”——权重本质上是模型在训练过程中学习并存储的信息。通常,每个权重需要16位(bits)来存储。PrismML采用的“三元”权重方法将其简化为三个值:+1、-1或0。由于每个权重需要存储的数值大幅减小,模型占用的空间也急剧减少。(如需深入了解该压缩技术,可查看该项目的Hugging Face页面 (https://huggingface.co/collections/prism-ml/bonsai-2)。) 这家初创公司的下一个目标是将这种压缩技术应用于更大的模型。Hassibi告诉TechCrunch:“我们预计将在未来几个月内发布下一个模型,其参数规模将达到数千亿级别,并且我预期在那里会更容易保持模型的智能水平。” 他补充道,随着模型规模的增长,“在不损失智能的前提下进行压缩的空间更大了。所以我可以说,总体趋势是,对于更大的模型,实现100%(性能对等)会更容易。” Stoica告诉我们,他之所以对这项技术感到兴奋,是因为它使得先进模型能够在用户设备上运行。“你将拥有触手可及的智能,而且它将是免费的,因为它将运行在你已经购买的设备上。它还将保护隐私,因为你无需将其发送至云端。” *当您通过我们文章中的链接购买商品时,我们可能会获得少量佣金 (https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*

相似文章

prism-ml/Ternary-Bonsai-2-27B-mlx-2bit

Hugging Face Models Trending

Prism ML 发布了一款三元权重27B级AI模型,专为Apple笔记本电脑的本地使用优化,以8.60 GB的占用空间和约47 tok/s的性能,保留了98.2%的全精度智能。

prism-ml/Bonsai-27B-gguf

Hugging Face Models Trending

Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。