标签
Ornith-1.0-35B GGUF 模型更新引入了原生 MTP 推测解码嫁接,可在单 GPU 上实现更快推理,解码速度提升约 1.3-1.35 倍,同时保持几乎相同的 token 分布。提供了多个量化版本的吞吐量、TTFT 和长上下文性能的基准数据。
像DeepSeek和Qwen这样的中国AI模型,以比西方同类产品低5至20倍的成本提供有竞争力的性能,正在重塑AI经济学并推动多模型部署策略。