high-speed-inference

标签

Cards List
#high-speed-inference

@StefanoErmon: 今天我们很高兴宣布 Mercury 2.5。它是目前市场上最强大的扩散大语言模型。它是智能方面40%的飞跃…

X AI KOLs Timeline ↗ · 2026-09-08 缓存

Mercury 2.5 被宣布为最强大的扩散语言模型,智能方面比 Mercury 2 提升 40%,在 NVIDIA GPU 上运行速度超过每秒 1,100 个令牌,并针对生产进行了优化,具有低延迟和低成本。

0 人收藏 0 人点赞
#high-speed-inference

Nifer 太疯狂了。在 Qwen 3.6 35B 上实现每秒 700 个 token(无思考模式)。专为 RTX 5090 打造。同时支持完整的 25 万上下文。

Reddit r/LocalLLaMA ↗ · 2026-07-27

Nifer 是一款工具,能够在 Qwen 3.6 35B 上实现每秒 700 个 token 的推理(无思考模式),专为 RTX 5090 优化,并支持完整的 25 万上下文。

0 人收藏 0 人点赞
#high-speed-inference

@ClementDelangue: Kog 在 @huggingface 上开源了用于展示模型每秒 3000+ tokens 速度的 2B 模型。非常……

X AI KOLs Timeline ↗ · 2026-06-24 缓存

Kog 开源了 Laneformer 2B 模型,这是一个 23 亿参数、经过指令调优的编码模型,专为高速解码设计。通过从架构阶段优先考虑延迟,实现了每秒超过 3000 个 token 的生成速度。

0 人收藏 0 人点赞
#high-speed-inference

@zephyr_z9: 这太重要了,我认为这是第一个实用的推测解码方法,部署在大型准前沿模型上 M…

X AI KOLs Following ↗ · 2026-06-08 缓存

小米 MiMo 发布 MiMo-V2.5-Pro-UltraSpeed,通过推测解码在 1 万亿参数模型上实现每秒超过 1000 个 token,这是首次大规模实际部署如此速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈