Qwen 3.8 27B 在Cerebras平台上以1500 tokens/s的速度推出
摘要
Cerebras宣布在其推理平台上提供Qwen 3.8 27B模型,速度达1500 tokens每秒,并详细介绍了其模型压缩技术,如量化和剪枝。
暂无内容
查看缓存全文
缓存时间: 2026/09/03 20:59
# 模型目录 - Cerebras Inference
来源:https://inference-docs.cerebras.ai/models/overview
浏览Cerebras公共端点提供的所有模型\。
Cerebras公共端点上的模型适用于免费试用和按量付费层级,但需遵守速率限制 (https://inference-docs.cerebras.ai/support/rate-limits)和定价 (https://inference-docs.cerebras.ai/support/pricing)\。如需更多模型系列、预留容量、更高吞吐量及生产级SLA,请参阅专用端点 (https://inference-docs.cerebras.ai/dedicated/overview)\。
## 可用模型
## 模型压缩
本节详细说明我们平台上各模型的压缩状态\。我们托管了来自社区的多种开源模型\。当前公共端点暂不提供剪枝模型\。所有通过公共端点提供的模型均为原始未剪枝版本\。尽管我们对REAP(路由器加权专家激活剪枝)等剪枝技术进行研究,但这些剪枝模型仅通过Hugging Face与研究社区共享,不通过我们的共享API提供\。您可以在我们的研究博客 (https://www.cerebras.ai/blog/reap)了解更多关于REAP的信息\。**我们所有公开模型均为未剪枝版本\。** Cerebras仅在存储阶段采用选择性仅权重量化以最大限度保留模型质量\。这意味着权重以部分16位/8位/4位格式存储,符合行业标准\。为保证质量,敏感层以全精度存储并实时反量化,因此运算在高精度下进行\。激活值、注意力机制及KV缓存始终保持全精度且未被量化\。
### 常见问题
您会在未通知的情况下更改模型架构吗?
不会\。我们承诺为所有现有端点提供原始模型,不做任何修改\。我们不会通过托管的产品组合对模型架构进行剪枝处理\。若未来探索其他压缩技术(如剪枝),这些模型将作为独立端点提供,并采用剪枝专属命名,确保完全透明并让您自由选择最符合需求的版本\。
在哪里可以找到您的REAP剪枝模型?
我们的REAP剪枝模型可在Hugging Face上获取,仅供研究和实验用途:Cerebras REAP集合 (https://huggingface.co/collections/cerebras/cerebras-reap)\。这些模型展示了我们的剪枝研究成果,但不通过生产环境API提供服务\。
什么是压缩、量化和剪枝?
**压缩**是降低模型大小或计算需求的技术总称\。常见压缩技术包括:
- **量化**:降低表示模型权重的数字精度(例如从FP16转换为FP8)\。这能在不改变模型架构的前提下减少内存占用\。
- **剪枝**:永久移除模型的部分组件(如层或专家)以减小模型体积\。这会改变模型架构并生成新模型\。
相似文章
Qwen3.8-27B:更慢的词元,更快更好的结果
Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。
Qwen 3.8 27b 即使在 Q3_xxs 下也很强大
用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。
Qwen3-8B 2.4T 在 Nvidia GB300 NVL72 上达到 288k tokens/s
NVIDIA 展示了在 GB300 NVL72 硬件上运行 Qwen3-8B 2.4T 参数模型的高吞吐量性能,实现每 GPU 超过 4k tokens/s。
Qwen 3.8 27B 比预期更快
一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。
Qwen3.8-27B在24GB RTX PRO 4000 SFF上以256K上下文运行(432 GB/s带宽):通过MTP实现每秒50个token
本文详细描述了一项实验,该实验在24GB GPU上使用多token预测和自定义优化,实现了Qwen3.8-27B在256K上下文下每秒50个token的推理速度。