小米刚刚声称在标准8-GPU服务器上对1T模型实现了1000+ tps

Reddit r/LocalLLaMA 模型

摘要

小米与TileRT合作发布了MiMo-V2.5-Pro-UltraSpeed,在1万亿参数模型上实现了超过1000 tokens/s的解码速度,支持实时AI交互,并加速了编程代理和推理任务。

刚刚看到小米MiMo宣布了**MiMo-V2.5-Pro UltraSpeed**,声称他们突破了**1万亿参数MoE模型上1000 tokens/s的输出瓶颈**。据他们称,这是在**单个标准8-GPU节点**上实现的,而非Cerebras那样的定制晶圆级硬件,也非Groq那种大量使用SRAM的硬件。如果属实,那太疯狂了。
查看原文
查看缓存全文

缓存时间: 2026/06/08 17:20

# 小米MiMo,探索与热爱 来源:https://mimo.xiaomi.com/blog/mimo-tilert-1000tps 标志 2026年6月8日 ## MiMo-V2.5-Pro-UltraSpeed:将1T参数模型生成速度提升至1000 TPS 立即试用 › (https://ultraspeed.xiaomimimo.com/) 访问API › (https://platform.xiaomimimo.com/ultraspeed) 中文 › (https://mimo.xiaomi.com/zh/blog/mimo-tilert-1000tps) ## 1. 小米MiMo-V2.5-Pro-UltraSpeed:速度是终极优势 从内燃机时代第一辆咆哮的赛车到突破音障的音爆,人类对速度的渴望刻在DNA里。AI推理的速度同样如此——它定义了智能本身的边界。当模型足够快时,它就不再是你需要等待的工具,而是你思维的延伸:实时响应、瞬间迭代、无摩擦协作。 **今天,我们激动地宣布与TileRT合作发布小米MiMo-V2.5-Pro-UltraSpeed,首次在1万亿参数模型上突破1000 tokens/s的解码速度!** MiMo-V2.5-Pro UltraSpeed实时生成速度对比(最高约1200 tokens/s) ## 2. 限时开放 · 基于申请 MiMo-V2.5-Pro-UltraSpeed API同步上线,限时优惠价格——是MiMo-V2.5-Pro成本的3倍,但提供约10倍的生成速度!**3倍价格,10倍输出体验。**(仅限API;不支持Token计划。) 由于高速推理资源有限,MiMo-V2.5-Pro-UltraSpeed将通过申请制限时窗口开放。获批用户可在试用期内访问API,仅限**2026年6月9日至2026年6月23日23:59(北京时间,UTC+8 / 08:59 PDT)**。 ### 如何申请 API平台:platform.xiaomimimo.com/ultraspeed (https://platform.xiaomimimo.com/ultraspeed)。试用名额有限,提交申请不保证获批。我们将优先考虑有真实业务需求的企业和专业开发者。如需标准模型访问,请关注MiMo-V2.5模型系列。如需UltraSpeed模型的深度业务合作,请联系 [[email protected]](mailto:[email protected])。 ### 聊天体验(试用期间免费) 获批用户将在两周窗口期内获得免费的Chat访问权限。入口:ultraspeed.xiaomimimo.com (https://ultraspeed.xiaomimimo.com/) 为确保资源受限下的质量和公平性,适用以下规则:每个账户每天最多进入队列10次;每次会话最长30分钟;会话空闲超过5分钟将自动释放。 ## 3. 1000 tokens/s:不仅仅是快,更是范式转变 在万亿参数(1T)规模下,突破1000 tps远不止是打字速度更快——它从根本上颠覆了AI应用的范式。 **首先,速度本身开始转化为智能。** 过去,面对难题你只能“等待一个答案并祈祷它正确”。现在,在相同的挂钟时间内,模型可以并行运行数十条推理路径(Best-of-N / 树搜索),自动验证并在后台自我修正——用原始速度产生思考深度,直接提升推理质量。 **其次,它彻底解放了编码智能体的生产力天花板。** 过去让AI写代码意味着开发者痛苦地守在屏幕前,受限于推理延迟。在1000 tps下,代码生成速度和生产效率经历范式级别的加速。 **最重要的是,万亿参数模型现在可以进入实时决策循环。** 毫秒级的“思考-响应”周期使得1T旗舰模型能够无缝接入时间敏感场景——高频量化交易信号生成、即时反欺诈拦截、智能竞价以及实时交互对话。而当这种能力被带入生死攸关的外科辅助和医学影像分析时,**AI速度不再仅仅是效率指标,而成为与死亡赛跑中的一枚芯片。** 在手术台上,AI完成病变分析和风险预测每节省的一秒钟,都给了外科医生多一分的操作自由度。这加深了我们的信念:速度的终极意义不仅仅在于提升生产力,而在于让技术帮助人类生活得更好。 ## 4. 极致的模型-系统协同设计 实现1T旗舰模型1000+ tokens/s的生成速度并非单一技术的突破——它是MiMo模型团队与TileRT系统团队深度协作和极致协同设计的产物。当前业界实现类似极端速度通常依赖专用硬件——Cerebras的晶圆级集成或Groq的纯片上SRAM定制架构。我们选择了不同的路径:仅通过模型-系统协同设计,在**商用GPU**上实现更令人瞩目的推理速度。 在模型侧,我们针对商用硬件的带宽瓶颈应用了**FP4量化**,大幅缩小模型尺寸并减少内存访问开销;同时引入**DFlash,一种基于块级掩码并行预测的高效推测解码方法**,显著增加每次验证步骤中接受的token长度。在系统侧,TileRT完美适配这些算法的动态特性,为新型量化和推测解码流水线提供量身定制的编译引擎和计算内核。**通过这种极致的协同设计,我们仅使用单个标准8-GPU商用节点,就实现了1T模型1000+ tokens/s的输出。** ### 3.1 FP4量化 在万亿参数(1T)规模下,传统的8位(FP8/INT8)甚至16位推理会带来巨大的内存占用和带宽压力。减少参数位宽直接提升解码速度。因此我们采用了广泛验证、几乎无损的FP4 (MXFP4) 量化格式[1]。 然而,在整个模型上直接应用FP4会导致复杂推理、逻辑和代码生成能力下降。考虑到小米MiMo-V2.5-Pro的MoE(混合专家)架构——其中专家参数占绝大多数且对量化容忍度最高——我们选择仅将MoE专家量化到FP4,而保持所有其他模块的原始精度。通过FP4 QAT(量化感知训练),我们在大幅减小模型尺寸、最大化硬件带宽利用率的同时,使模型的整体能力基本保持与原始模型一致,如下所示: FP4量化(仅MoE专家)与FP8在基准测试上的模型能力对比,整体能力与原始模型基本持平 ### 3.2 DFlash推测解码 传统的推测解码依赖一个小型草稿模型“猜测”后续token,然后由大模型进行验证。这将自回归生成(每次前向1个token)转化为并行多token生成,验证过程中的拒绝采样保证了无损输出质量。然而,其瓶颈在于草稿模型的质量决定了接受率,而更强的草稿模型又带来更高的计算开销——这是根本性的矛盾。 为了打破这一僵局,我们采用了**DFlash**,一种来自学术界[2]的创新块级掩码并行预测方法:草稿模型在单次前向中填充整个掩码块的位置,从根本上消除了“自回归草稿”的串行约束。 我们将此方法部署在MiMo-V2.5-Pro上,并针对万亿规模MoE和长上下文场景进行了定制优化。通过Muon二阶优化器和模型自蒸馏,确保紧凑的掩码块仍能提供理想的接受率,同时将草稿阶段开销压缩到接近理论最小值: - 草稿模型仅使用滑动窗口注意力(SWA),与MiMo-V2系列的SWA设计自然对齐。这消除了对完整前缀的依赖,将每次预测的计算量从随上下文长度线性增长降为常数。 - 训练过程中,掩码信号采样下放到GPU本地分片,使得单个序列能够一步产生数万个覆盖不同上下文位置的独立训练信号——与MiMo-V2系列的长上下文能力保持一致,同时避免了跨设备通信开销。 在结果上,我们的并行预测推测解码在高价值智能体和编码场景中实现了显著的接受长度提升,意味着大模型每次验证可以“一口气”确认更多内容。此外,我们将块大小限制为8以减少验证开销并提高并发度,使得高接受长度直接转化为高推理吞吐量: | 场景 | 接受长度 | |------|----------| | 编码 | 6.30 | | 数学/推理 | 5.56 | | 智能体 | 4.29 | 在编码场景中,我们实现了6.30的平均接受长度,部分样本最高达到7.14——即每次验证的8个草稿token中有6-7个被接受。草稿模型保持轻量,同时将接受率推至能带来实际端到端收益的水平。我们同时观察到,在语义发散性更强、不确定性更高的通用对话场景中,当前的接受率还不够高。我们正在持续优化算法以探索更高的泛化天花板。 ### 3.3 TileRT超低延迟推理内核/系统 如果说MiMo的算法创新解开了百亿和万亿参数模型的带宽束缚,那么TileRT推理系统则将商用GPU的物理潜力榨取到微秒级别。 在1000 tokens/s的运行频率下,每个算子的生命周期被压缩到微秒级,传统推理系统的“算子边界”成为核心瓶颈——每一次算子启动、硬件同步和全局内存往返都会在微秒尺度上割裂执行流,暴露出可见的“执行间隙”。 #### TileRT的范式级执行模型革命 作为超低延迟推理的基础设施,TileRT引入了全新的执行模型,从根源上消除算子边界带来的执行间隙: - **持久引擎内核:** 完全抛弃传统的逐算子启动范式,使整个计算流水线持久的驻留在GPU中流动。这使得全流水线连续预取成为可能——当当前Tile仍在张量核心上计算时,后续数据已通过内存层级流动,实现数据移动与计算的极致重叠。 - **线程束专业化(异构流水线协作):** 在Tile层面,通信、数据移动和张量计算以更细粒度物理分解。打破同质化锁步执行模型,不同线程束(Warp组)甚至整个GPU上的异构执行域独立运行但又精确协调——将GPU转变为一个持续流动、精确编排的异构执行系统。 #### 微秒级软硬件深度收敛(协同设计) 当底层执行模型将硬件性能推向极限时,纯运行时优化开始触及物理边界。在此基础上,TileRT系统团队与小米MiMo团队进行了深度技术共创,打破了传统的软件层边界。为了使模型行为完美对齐这一超低延迟执行流水线,模型层最终采用了MoE专家的混合FP4量化策略,并在万亿参数架构上部署了与SWA对齐的DFlash推测解码。TileRT紧密耦合这些算法特性和量化方案,提供量身定制的编译引擎和计算内核。两个团队基于硬件物理限制做出了深刻的联合工程权衡,确保执行压力在硬件边界内平滑闭合。 1000 tokens/s的诞生不是点优化的巧合。它是世界级系统基础设施与极致算法模型深度融合、相互演进、一体共生的必然结果。 TileRT是一个专注于下一代AI基础设施和超低延迟推理的前沿系统架构团队。该团队致力于将前沿大模型在生产环境中实现毫秒级实时响应,以全新的运行时架构打破传统的存储-计算壁垒。团队构思并实现了范式级的执行模型,通过持久内核、Tile流水线和异构协同的全栈突破,在复杂异构生态中实现极致计算利用率。作为核心基础设施使能者,团队积极与行业领先合作伙伴进行软硬件协同设计,为渴望“终极速度”的自主智能时代构建高性能计算基石。更多TileRT技术详情:tilert.ai/blog/breaking-1000-tps.html (https://www.tilert.ai/blog/breaking-1000-tps.html) ## 5. 更多演示 仅10秒构建贪吃蛇游戏 仅10秒构建贪吃蛇游戏 仅1分钟重现MacOS界面 仅1分钟重现MacOS界面 ## 6. 开源与展望 - 我们已在HuggingFace上开源了**MiMo-V2.5-Pro-FP4-DFlash**检查点,包括FP4量化权重和DFlash模型参数。欢迎社区使用和反馈:huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash (https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash) - **MiMo-V2.5的UltraSpeed支持**正在路上——敬请期待。 MiMo × TileRT —— 极致的模型-系统协同设计,为万亿参数模型带来1000 tps输出速度。

相似文章