Stefano Ermon:自回归推理是顺序执行且受内存限制的。扩散模型设计用于映射到GPU——这就是它获胜的原因。
摘要
Augment Code将其编码代理后端切换到Stefano Ermon的Mercury 2.5扩散模型,在生产环境中实现了82%的延迟降低和90%的成本削减。文章强调了扩散模型的性能优势以及独立AI基准测试工具的必要性。
摘要:Augment Code在九月份更换了其生产环境中的编码代理后端。它没有切换到更大的模型,而是切换到一个更小的模型,运行在非逐个生成token的架构上——Stefano Ermon的Mercury 2.5——且数据对比悬殊:延迟降低82%,成本下降90%,这是在已发布的产品中实现的,而非基准测试演示。
扩散模型并行生成token块。这正是你在晚上11:47点,GPU利用率为18%时所对抗的瓶颈,而昨天的KV-cache调优只为你带来了额外的四个百分点。这不再是论文——Artificial Analysis独立测量其速度为每秒770个token,而Inception自身声称1,107,即使保守数字也很可能是真实的,已部署并承载负载。它并不能让你更安全。每个治理文档——如RSP、准备框架、欧盟AI法案附件III、一项未能通过全院表决的劳工法案——都规范模型可能输出什么,但都没有规范工程师的风险,他们的专业知识都建立在刚刚被超越的技术栈部分上。
差距:无人构建中立测试——一个让你用自己的流量、在同一机器上对比Mercury风格的扩散模型和当前自回归栈、且无人评判自己作业的地方。Artificial Analysis的Optima和SemiAnalysis的InferenceX接近目标,但两者都无法在你自己的数据上、以你自己的并发度并行运行两种架构。开放。可行——Optima席位每月417美元,一家名为Vals的基准测试初创公司获得4000万美元融资,表明资金已在流动,资源门槛现实:DiffusionGemma开放权重发布,按需H100每GPU小时3.41美元。最快的方式不是击败现有者——而是率先提供开放、公开、同骨干的结果。Gemma 4 26B-A4B与其扩散兄弟DiffusionGemma对比,同一GPU、同一vLLM、方法公开。这正是InferenceX、Artificial Analysis和LMArena各自通过率先且开放所占据的位置——而销售方最终会引用裁判(Inception自己的Mercury论文引用Artificial Analysis)。
盈利期:无法从自身可用研究估计——但基于下面可行性中概述的规范/路线图,第一个付费裁决在该任务内就能覆盖其计算成本(约34-68美元GPU时间,以每月417美元席位作为价格锚点)。
https://preview.redd.it/curnllam4lrh1.jpg?width=1024&format=pjpg&auto=webp&s=29775579a009fe6254ab04ca2142e9d86c89a052
可行性:
机会:开放差距——没有产品满足独立、自有流量、在你自己机器上进行自回归与扩散测试的所有六个要求。
可行:相邻产品已定价并销售。
规范:跟踪你自己的流量样本,两种架构在相同硬件上,以你自己的并发度测试延迟和GPU利用率,每个完成任务的成本,你自己的质量评分标准,方法公开——无其他关键负载。
路线图:(1) 在一个租用的H100上,通过vLLM对比Gemma 4 26B-A4B与其扩散兄弟DiffusionGemma 26B-A4B,针对你自己的流量匿名样本;(2) 公开方法和首个结果;(3) 通过其OpenAI兼容API添加Mercury 2.5作为外部参考点;(4) 将首个裁决作为固定范围工作出售,然后产品化。
三大假设:(1) 面临此决策的团队会支付独立、自有机器裁决,而非自己运行——测试:访谈。(2) 单机结果可转移到真实团队栈和流量——测试:针对一个匿名样本进行礼宾运行。(3) 在已发布构建上的扩散服务足够稳定以清晰测量——测试:端到端运行完整工具包并检查其可重复性。
可行性快照:技术——通过,但采样器设置和扩散服务支持仍在变动。
单位经济学——通过,基于已发布计算定价。
盈利期——风险,时机不可估计。
数据护城河——风险,方法可复制;不可复制的是率先和受信任。
法律合规——风险,未研究:处理他人生产流量和供应商发布结果的条款,两者均未检查。
MVP定义:输入是匿名流量样本加你自己的通过/失败评分标准;机制是同一机器上跨两种架构的回放;输出是一页裁决;检查点是你在信任任何数字前审查样本。
通过/失败:三次重复运行在p95内一致10%;自动评分至少90%与人工审查一致;至少一个团队付费。
反目标:无公开排行榜,无训练或微调,无模型托管,无通用前沿模型排名。
上市策略:前十个客户是AI原生公司中约150人以下的推理或ML平台负责人,已运行vLLM,已在问“为什么不用扩散”。开放、公开结果是获客渠道——与InferenceX、Artificial Analysis和LMArena各自借以获得首批用户的渠道相同。
反对内部进行的切换案例:数天而非数周——未注明来源估计。
融资:无需资金达到付费试点。为扩展,类似中立测量公司已融到真金白银——一家以17亿美元估值获得1.5亿美元,另一家融4000万美元——AI种子轮中位数约460万美元,尽管此细分市场不需要。
标签估计,非来源事实。
决策门:在首次礼宾运行后,仅当至少一个团队同意付费试点且结果在当前已发布vLLM构建上可重复时,才进行。否则终止。
标签估计。
_____________________________________
当年我在马来西亚最大的建筑主承包商之一——SC工作时,我们还有一个名为SP的姐妹子公司,负责桩基工程。每当项目涉及基础工程——通常包括打桩——我们总会让SP与我们合作。但问题变得棘手。那时SP只能做小型预制RC方桩,其承载能力非常有限。如果项目要求更复杂和困难的基础工程,就超出了SP的能力范围。因此,经过深思熟虑和广泛可行性研究,SP的老板升级了整个公司——引入钻孔桩,其直径更大——以满足高层建筑和其他重型项目的基础工程需求。他将其更名为SG——G代表岩土工程。不用说,SG必须招募的专业知识和重型机械投资是巨大的。但这给了SG追求高利润项目的灵活性。我记得看着他们最新项目中大型筏板基础(包括下面的钻孔桩)的进展,惊叹道:“哇!这个筏板基础真庞大!”SG的老板冒了很大风险,并获得了巨大回报。
_______________________________
每个“这改变一切”的帖子都会被下一个淹没。那些不被淹没的,是旧事物的建造者保持沉默的。关注谁停止捍卫自己的技术栈,而不是谁的技术栈被击败——这通常是真正的迹象。
📉 分享你的观点:如果并行token押注是真的,“我的内核是自回归”仍然是护城河——还是同2016年RNN派说的那句话一样?🤔
片段来源:No Priors(Sarah Guo & Elad Gil)——与Stefano Ermon的访谈。如需署名或删除请求,请私信。
相似文章
@StefanoErmon: 今天我们很高兴宣布 Mercury 2.5。它是目前市场上最强大的扩散大语言模型。它是智能方面40%的飞跃…
Mercury 2.5 被宣布为最强大的扩散语言模型,智能方面比 Mercury 2 提升 40%,在 NVIDIA GPU 上运行速度超过每秒 1,100 个令牌,并针对生产进行了优化,具有低延迟和低成本。
扩散模型与自回归模型之争终于有了一个干净的数据点,而它所指向的结论远比炒作中的更窄
LLaDA2.2背后的实验室发布了一个扩散模型,并将其与自家的自回归模型进行基准测试,结果显示扩散模型在通用知识和编程方面落后,但在速度和智能体任务上胜出,提供了一个清晰的权衡数据点。
Inception Labs 的 Mercury 2 AI 在 Google 的 DiffusionGemma 擅长的领域击败了它(4分钟阅读)
Inception Labs 发布了 Mercury 2,这是一个扩散语言模型,每秒可生成约1000个token,在 AIME 2026 基准测试中以 90% 对 69.1% 的得分优于 Google 的 DiffusionGemma,不过 DiffusionGemma 是免费且开源权重的,而 Mercury 2 是付费且闭源权重的 API 模型。
来自NVIDIA的Nemotron-Labs-Diffusion
NVIDIA发布了Nemotron-Labs-Diffusion模型系列(3B至14B),该系列同时支持AR解码和扩散解码,并采用新颖的自推测机制,在多种硬件平台上相比标准AR和Eagle3方法实现了显著加速(最高达4倍)。
Apple M3 Ultra上实时扩散模型推理的系统优化
本文对Apple M3 Ultra上的实时扩散模型推理进行了系统优化研究,通过CoreML转换和蒸馏模型在512x512分辨率下达到了22.7 FPS,揭示了针对CUDA优化的技术无法直接迁移到Apple统一内存架构。