标签
Kimi K3 权重今日发布。该模型拥有2.8万亿参数、MoE架构(896个专家)、100万上下文、视觉能力以及MXFP4量化。在A100和H200上部署需要多节点,但单个B300节点即可容纳。预计本周末将公布各GPU配置下的tok/s、ttft及每百万token成本等基准数据。
GitHub上的一个开放数据集绘制了哪些本地LLM适合不同的内存层级(8GB到128GB),提供了内存大小规则、每层模型列表和Ollama命令,并带有用于编程访问的JSON API。