在您的个人硬件上运行前沿AI
摘要
Tim Dettmers宣布dlab的开源周活动,该活动将发布一系列开源工具,旨在让前沿AI技术能够在个人设备上运行,并论证学术界在AI研究中迎来复兴的潜力。
暂无内容
查看缓存全文
缓存时间: 2026/09/21 21:46
# dlab 开源周:在您的硬件上运行前沿人工智能——Tim Dettmers
来源:https://timdettmers.com/2026/09/21/dlab-open-source-week/
在我的一次课堂上,我问出了自己一直不敢问但又迫切需要答案的问题:“谁担心毕业后找不到工作?” 教室里150人中约有80%举起了手。这相当于120名学生以行动表示,他们不相信未来有属于自己的一席之地。
另一个故事则来自电子邮件。一些博士生迫不及待地想要毕业,因为他们希望加入前沿实验室,并断定学术界的研究已毫无意义。他们正数着日子等待离开的那一天。
我认为这两种观点都是错误的,且错因相同。它们都默认研究的未来属于拥有最多GPU的人。我认为事实恰恰相反。学术界可能正迎来一场复兴,未来十年最激动人心的研究成果将诞生于大学实验室——不是因为资源有限,而是正因为这些限制。
本周,我们将以代码而非文字来论证这一主张。
本文包含六个部分:为何像我们这样的实验室如今发布的是生态系统而非论文;本次开源周实际包含哪些内容;我所遇到的悲观论调为何是错误的;应当放下什么,又该坚守什么;当你放下之后,研究将呈现何种形态;以及为何复兴会发生在学术界。
## 研究的单位不再是论文
过去一年间,某些东西发生了变化,而我们大多数人的习惯尚未随之更新。
借助智能体,按项目开展研究已变得轻松快捷。过去需要一年工程与实验的工作,如今几周甚至几天就能完成。我花了更久才意识到的部分是:当每个独立项目都变得容易时,零散的工作就不再是好的研究了。这里一篇论文,那里一篇论文,每篇都自成一体,要求读者自行拼凑——那是在每个组件都代价高昂的世界里才适用的范式。
困难并未消失,只是转移了。如今发表论文已不再困难,困难的是发布一个连贯的生态系统。
研究的单位是生态系统。
这正是开源周的意义所在。当我和学生们启动这个项目时,我们的目标是构建相互依赖而非仅仅并存的组件,使每个部分都能提升下一部分的价值。我的实验室相信利用我们的学术自由,为所有人免费带来最优秀的AI工具。这是大学能够独特地做到的事情。具体而言,这意味着构建开放系统,让模型在本地运行的成本更低、性能更强,建立能够深度自主复现前沿研究表现的本地系统,并开发构建领域特定强化学习环境的新方法。
所有这些都交汇于三个领域的交叉点:推理服务框架、智能体工具与工作,以及两者结合形成的自主研究系统。而且这一切必须易于使用,因为只有经验丰富的研究者才能运行的开源项目不是真正的开源。可及性包含两面——所需的资源与所需的专长——而硬件只能解决其中一面。几张GPU,或一台MacBook,就已足够。专业要求是一个设计问题,你需要通过抽象掉用户无需考虑的所有技术细节来解决它。我们大部分努力都投入于此,并在智能体工具中体现得最为明显。
在开源周正式开始前,我不会透露全部内容,以下是我目前可以告诉你的。
如果你问一个小实验室今天能做些什么,我们将向你展示三件事:前沿的自主研究、我所知的最高效的测试时扩展,以及比Claude Code或Codex所实现的自动压缩技术高效得多的自动压缩方案。
先从工具讲起,因为它是让其他一切可用的基础。
你可能听说过持续运行数小时、数天甚至数周的智能体会话。对大多数人,尤其是从未使用过智能体的人来说,这很神秘。你只需将我们的工具指向一个代码库——例如一个包含CUDA内核的推理框架——告诉它优化这些内核,然后就可以离开。它会在进展缓慢、工作令人沮丧的阶段持续改进,直到你回来。过程中不会提供任何反馈,因此智能体必须在遇到不确定情况时自行摸索解决。
这正是我们在推理框架的Mac和Metal实现上所做的。一条命令让智能体在内核上自主工作。回来的结果是:Qwen 3.6 35B-A3B模型以每秒450个令牌的速度进行量化推理,在每权重1.5位时输出质量已很高。一个半精度模型需要每权重十六位;而在1.5位下,相同模型仅需约十分之一的内存运行,并且速度之快,让你感觉像本地进程而非远程服务。
然后便是本文标题的主题:当曾经遥不可及的模型能够运行在你已拥有的硬件上时,会发生什么?
270亿参数的Qwen 3.8是当下流行的本地模型。我们的框架让你能在单张24GB显卡——普通台式机中的显卡——上运行其更大版本:1250亿参数的Qwen 3.8 Flash Next。使用AMD Strix、NVIDIA DGX Spark或配备128GB内存的MacBook,你还能运行550亿参数的DeepSeek V4.1。你也不必再管理上下文长度:压缩和上下文处理是自动的,即使在长上下文中推理也能保持快速。
接下来是我最兴奋的部分。
我们将这些组件结合起来,进一步推进自主研究,并在此过程中构建了一种前所未见精确度的新信息检索技术。该系统超越了前沿实验室的深度研究系统,产生的自主研究结果优于Sakana AI的系统或谷歌的ScientistOne。它完全本地运行,无需任何网络访问。
使用方法很简单。让我分享一个我运行的实验。
我要求智能体在生物信息学领域——因为我对此了解不多——找一个值得研究的问题,标准很明确:进展必须快;评估必须足够便宜,能在我们现有硬件上运行;而且必须是一个新问题,领域内有过去四周内发表的活跃研究,确保我们研究的是尚未定论的方向。智能体给出了三个问题。我们选取了第一个,大约两小时内,它确立了启发式方法的新下界,开发并测试了文献中最佳的启发式方法,更接近使用AI模型训练的昂贵方法,并发现了所有人用于评估该问题的数据源中的问题。我们并未在整体问题上达到最先进水平。但即便如此:实验室机器上两小时的工作产出了四项成果,其中一项质疑了该领域依赖的评估数据。
这个系统并非仅为博客文章展示的演示项目。我的学生们每天都在使用它。在整合进工具之前,它存在于一个Slack机器人中,当时它还不太稳定,机器人会偶尔掉线。我没有设置邮件系统来提醒我Slack机器人离线,但我有次好的替代品:学生们常写信给我说,“Tim,Slack机器人好像出问题了,你能帮忙看看吗?”在协作场景中,我曾在会议录像后使用它:它从录像中生成研究问题,对照文献评估讨论的创意,筛选出有前景和没前景的方向。然后创建一份谷歌文档并发给学生。我这样做过两次会议。学生们很喜欢,但因为流程中需要我手动复制粘贴两部分内容,操作繁琐,我便停用了。接下来的两次会议我没用它——然后学生们满怀期待地问我,能否再次使用该系统,因为他们觉得这对理解自己的研究非常有帮助。
这是我唯一信任的研究工具评估方式:当你停止提供后,人们会主动索求。
最后一点是我们使用最多却谈论最少的:如何在对话结束后让智能体继续工作?
我们的答案是一种名为CliffCompaction的自动压缩技术。我们在实验室中已使用数月,我个人再也不想在没有它的情况下运行智能体。它比Claude Code或Codex中的自动压缩功能强大得多。使用它的会话可以运行数百万令牌,我的有些会话甚至超过一亿令牌。它还将总成本削减了约50%。我们的一位合作伙伴在其公司内部部署后,测量发现他们的AI总预算减少了45%——几乎一半的AI支出凭空消失,且未牺牲任何功能。在KernelBench上,它达到了最先进水平,远超比我们复杂得多的方法,包括AlphaEvolve式方法和层次化记忆系统。我们将发布一个强力版本。我们已经掌握了下一代自动压缩技术的部分原理,它性能更优。
它同时改变了成本/能力权衡的两端:会话运行得更久,账单却变得更小。换句话说,智能体不再遗忘它正在执行的任务,你也不必为遗忘买单。
更长的会话,更低的账单。
这引出了我列表中的测试时扩展部分,因为它源于同一技巧。自动压缩节省了约50%的成本,你可以将这些节省重新投资:不再只进行一次推演,而是用同等预算进行多次。我们找到了首个实用的方法,能在同等成本下将多次推演转化为显著的性能提升。虽然目前还不适用于日常工程工作,但要达到那个水平并不难。结合通常未被充分利用的本地部署,我们相信这将带来一个未来:任何人都能在单个问题上运行多个并行智能体。
## 悲观论调为何错误
那么,为什么那150名学生中有120人感到害怕?
有三件事同时发生,其中只有一件关乎AI。第一是相信AI会抢走所有人的工作。第二是对AI如何改变工作缺乏理解。第三是传染:自我挫败的观念在人与人之间传播,一个房间里听同一句悲观论断听了十遍的人,会产生第十一个举手的人。
让我们先从AI如何改变工作说起,因为这是我们能够理性分析的部分。
先从所有人预测会最先受到冲击的职业说起。人们曾预测软件工程师会最先失业,但最近的趋势却相反:对软件工程师的需求比以往更高。一个善用智能体的软件工程师能更高效地开发新产品、维护现有系统并进行扩展,因此公司从支付给该工程师的每一分钱中都能获得更多价值。工作所需的要求变了。它需要强大的智能体技能,并且往往比以前需要更深入的专业化——“软件工程师”这个工种已不复存在——而这两者现在都触手可及:智能体技能随时间积累,而深入的专业化过去需要多年,现在借助智能体可以快速掌握。
我们生活在一个注重渐进式改进的经济体中。下一代手机并不比上一代好多少;改进是真实但微小的,而且每年越来越难被察觉。许多服务也以同样方式趋同。Lyft或Uber的一次乘车体验与过去相比并无本质不同,而且很可能永远如此,因为已没什么可改变的了。你只能把同一件事优化那么多次,之后就没人再为下一个版本付费了。
进步有两种形式,表现截然不同。不妨称之为改进与能力:改进让你已有的东西变得稍好,能力则给你从未有过的东西。一个只产出第一种进步的经济体,无论其中每个人多么努力,都会存在天花板。那么,看看当技术带来第二种进步时会发生什么。
自动驾驶汽车是显而易见的例子,有趣之处在于它将以极不均衡的方式到来。在欧洲或亚洲等复杂地方驾驶还需数十年时间。但在网格状结构且交通有序的地方——美国大部分地区——它将更快实现,并在接下来二十年里带来巨大改变。机器人技术可能也走在类似道路上:家庭中的机器人将像洗衣机一样解放人力工作,而解放工作的意义不在于工作本身,而在于你能因此拥有的生活。
同样的逻辑也适用于你口袋里的设备。下一代手机可能不会快很多,因为芯片速度提升已近瓶颈。但它可能成为一种截然不同的设备。
再谈谈人们经常提起的案例:他们告诉我AI让产品变得更糟,这个问题值得诚实探讨。如今已是陈词滥调:生硬植入AI会破坏它所植入产品的体验,微软产品中的AI功能几乎普遍受到严重诟病。我认为这种反应是正确的,同时我也认为这是对整合方式的评判,而非对技术的评判。设计精良的AI体验会改变你的交互方式、工作方式和安排日程的方式。这样的版本是存在的,你能在做得好的地方感受到差异。ChatGPT就是最好的例证。
ChatGPT在美国普通民众中的普及一直缓慢。但不可否认的是,人们终会跟上,而当他们跟上时,这会对他们的生活产生影响——不是小影响,而是结构性影响。我们生产和消费知识的方式将永久改变。
这种改变会带来动荡和复杂性,我不想假装它不会。但动荡不是故事的终点。对新体验和新产品的需求驱动收入,收入驱动招聘,而招聘正是人们谈及“工作保障”时所指的含义。悲观的解读停留在动荡,并遗忘了一切随之而来的事物。
## 放下工作方式,而非自我
即将到来的未来是一次剧变,对许多人而言,它将是令人震惊、失望和幻灭的。但不必如此。
你当下能做的最有用的事就是放手。放下你做事的方式。放下你被教导的顺序——先学基础,再学通用方法,最后才是解决问题。放下你的价值存储在已学知识中的观念,因为你学习的工具在你使用时正在被重写。
放下做事方式不等于放下自我,而两者之间的区别正是关键所在。身份认同是必须坚守的底线:你做什么可以协商,但你是谁不可改变。我们每个人都做事以保持投入感并享受生活,当生活改变时,你度过每一天的方式也会随之改变——无论是新工作、组建家庭,还是许多其他事情。但人们始终忠于自己的个性——不是因为他们固步自封,而是因为他们喜欢。那就是他们的样子。我们都有缺陷,我们爱着某些人,我们为自己和他人坚守着某些重要的东西。技术不会触及这一切。一旦你坚定了自我认知,其他一切都会变得……
相似文章
@OpenAI: 我们相信前沿AI的益处不应集中在少数公司和资源充足的实验室中。研究者…
OpenAI宣布了一项计划,旨在将强大的AI工具交到研究者手中,让前沿AI的惠益不再局限于少数公司。
@Zephyr_hg: UC伯克利刚刚开源了一款可以在游戏PC上运行的前沿级AI。模型变得越来越便宜、快速、开源。A…
UC伯克利开源了一款可以在游戏PC上运行的前沿级AI模型,使得高级AI更易获取和负担得起,焦点转向用户设置以实现实际工作。
前沿实验室尚未使用大部分AI算力(26分钟阅读)
一项关于AI算力使用的分析显示,OpenAI、Anthropic、xAI、Google和Meta等前沿实验室目前使用的AI算力不到全球总量的一半,但它们的份额正在快速增长,这可能会影响规模扩展趋势。
本地前沿现在比 Sonnet 4.5 更智能
这篇文章强调,能在消费硬件上运行的AI模型正在缩小与前沿模型的差距,表明尖端AI将在几个月内免费应用于个人设备。
本地AI的实际可访问性如何,如果可负担的前沿模型访问不再持续会发生什么?
作者讨论了普通技术爱好者对本地AI硬件的可访问性,质疑廉价前沿模型的可持续性,并探讨本地设置何时比云服务更具成本效益。