由 Qwen 3.8 27B 驱动的操作系统,速率达每秒 1950 令牌!以下是 @Alibaba_Qwen 的 3.8 27b 在 1,950 令牌/秒下的实际效果…
摘要
演示一个基于 Qwen 3.8 27B 的操作系统,在 Cerebras 硬件上以每秒 1950 令牌的速率运行,其中模型权重充当实时软件生成的运行时环境。
查看缓存全文
缓存时间: 2026/09/15 05:37
由通义千问3.8 27B驱动的操作系统,速度达1950 tokens/秒!
以下是@cerebras上@Alibaba_Qwen 3.8 27B在1,950 tokens/秒的实际表现:
我编写了一个极简的Python Web服务器,将Cerebras推理转化为实时操作系统。
磁盘上零预装应用。
当你双击图标时:
- Python代理从通义千问27B获取1,950 tok/s的原始SSE流
- 计算器编译并挂载仅需11秒
- 完整的画布绘画工作室(含笔刷引擎)编译耗时10秒
在2,000 tokens/秒的速度下,软件即刻成为按需生成的即时幻觉。
模型权重本身就是操作系统运行时。
在1,950 tokens/秒的速度下,你还会构建什么?
Alok (@analogalok): 通义千问3.8 27B Cerebras推理数据:
速度:1,850 tok/s 成本:输入 $0.99/百万token | 输出 $1.49/百万token
智能涌现如数据库查询般迅捷。
标准60Hz屏幕每16.6ms刷新一次。
- 本地3090/4090(4-bit):75 tok/s(1.2 tokens/帧)
- Cerebras 通义千问3.8 27B:1,850 tok/s(31
相似文章
@RoundtableSpace: Qwen 3.8 27B 在本地 RTX 5090 上运行时,在个人基准测试中击败 Opus 4.8,速度高达每秒200个令牌,无需...
Qwen 3.8 27B 是一个拥有270亿参数的AI模型,在本地RTX 5090 GPU上运行时,在个人基准测试中超越Opus 4.8,速度高达每秒200个令牌,无需互联网或API访问。
Qwen 3.8 27B 在Cerebras平台上以1500 tokens/s的速度推出
Cerebras宣布在其推理平台上提供Qwen 3.8 27B模型,速度达1500 tokens每秒,并详细介绍了其模型压缩技术,如量化和剪枝。
Qwen 3.8 27B 比预期更快
一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。
@rohanpaul_ai: Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上达到每秒34个token,本地使用 atomic[.]chat,接受率达90%,即……
Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上本地运行,实现每秒34个token,草稿接受率达90%,通过 TurboQuant、GGUF 和 llama.cpp 实现,展示了笔记本AI推理的重大进步。
阿里巴巴XuanTie C950 RISC-V处理器以30 tps运行Qwen-3.8 27B
由TSMC制造的阿里巴巴XuanTie C950 RISC-V芯片,现能以30 tps原生运行Qwen-3.8 27B AI模型,体现了垂直整合能力,并支持高效的边缘AI部署。