Qwen 3.8 27B 在Cerebras平台上以1500 tokens/s的速度推出

Hacker News Top 模型

摘要

Cerebras宣布在其推理平台上提供Qwen 3.8 27B模型,速度达1500 tokens每秒,并详细介绍了其模型压缩技术,如量化和剪枝。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/03 20:59

# 模型目录 - Cerebras Inference 来源:https://inference-docs.cerebras.ai/models/overview 浏览Cerebras公共端点提供的所有模型\。 Cerebras公共端点上的模型适用于免费试用和按量付费层级,但需遵守速率限制 (https://inference-docs.cerebras.ai/support/rate-limits)和定价 (https://inference-docs.cerebras.ai/support/pricing)\。如需更多模型系列、预留容量、更高吞吐量及生产级SLA,请参阅专用端点 (https://inference-docs.cerebras.ai/dedicated/overview)\。 ## 可用模型 ## 模型压缩 本节详细说明我们平台上各模型的压缩状态\。我们托管了来自社区的多种开源模型\。当前公共端点暂不提供剪枝模型\。所有通过公共端点提供的模型均为原始未剪枝版本\。尽管我们对REAP(路由器加权专家激活剪枝)等剪枝技术进行研究,但这些剪枝模型仅通过Hugging Face与研究社区共享,不通过我们的共享API提供\。您可以在我们的研究博客 (https://www.cerebras.ai/blog/reap)了解更多关于REAP的信息\。**我们所有公开模型均为未剪枝版本\。** Cerebras仅在存储阶段采用选择性仅权重量化以最大限度保留模型质量\。这意味着权重以部分16位/8位/4位格式存储,符合行业标准\。为保证质量,敏感层以全精度存储并实时反量化,因此运算在高精度下进行\。激活值、注意力机制及KV缓存始终保持全精度且未被量化\。 ### 常见问题 您会在未通知的情况下更改模型架构吗? 不会\。我们承诺为所有现有端点提供原始模型,不做任何修改\。我们不会通过托管的产品组合对模型架构进行剪枝处理\。若未来探索其他压缩技术(如剪枝),这些模型将作为独立端点提供,并采用剪枝专属命名,确保完全透明并让您自由选择最符合需求的版本\。 在哪里可以找到您的REAP剪枝模型? 我们的REAP剪枝模型可在Hugging Face上获取,仅供研究和实验用途:Cerebras REAP集合 (https://huggingface.co/collections/cerebras/cerebras-reap)\。这些模型展示了我们的剪枝研究成果,但不通过生产环境API提供服务\。 什么是压缩、量化和剪枝? **压缩**是降低模型大小或计算需求的技术总称\。常见压缩技术包括: - **量化**:降低表示模型权重的数字精度(例如从FP16转换为FP8)\。这能在不改变模型架构的前提下减少内存占用\。 - **剪枝**:永久移除模型的部分组件(如层或专家)以减小模型体积\。这会改变模型架构并生成新模型\。

相似文章

Qwen3.8-27B:更慢的词元,更快更好的结果

Reddit r/LocalLLaMA

Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。

Qwen 3.8 27b 即使在 Q3_xxs 下也很强大

Reddit r/LocalLLaMA

用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。

Qwen 3.8 27B 比预期更快

Reddit r/LocalLLaMA

一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。