@eliebakouch: Kimi K3(总参数2.8万亿)是一个开源权重模型,与fable和gpt 5.6 sol竞争,同时价格便宜得多,……
摘要
Kimi K3 是一个开源权重的2.8万亿参数大语言模型,采用了线性注意力、潜在MoE和新激活函数等创新,以更低成本提供有竞争力的性能。
查看缓存全文
缓存时间: 2026/07/17 00:24
Kimi K3(总参数量2.8T)是一款开源权重模型,与fable和gpt 5.6 sol竞争,但价格低得多,简直不可思议。
我觉得我们还没意识到,扩展到这样的参数量并发布一款如此惊艳的模型有多厉害。他们从上代模型扩展了超过2倍,同时保留了诸如线性注意力(KDA)、分位数负载均衡、注意力残差等研究前沿的架构设计。
该架构采用了(稳定的?)来自NVIDIA的潜在MoE,拥有896个专家中的16个(专家稀疏度与DSv4相同),每个头使用muon优化器(类似GLM 5),新的激活函数“Sigmoid Tanh Unit (SiTU)”,以及由大神@Jianlin_S提出的QB负载均衡。
期待技术报告(他们提到会发布一份)和更多测试时计算曲线,并在自己的研究任务中进行测试。不过总体来看,这真的不错,而且这仅仅是开始。
K2.5到K2.7的进步令人印象深刻,K3到K3.2很可能也会如此!
Kimi.ai (@Kimi_Moonshot): 推出Kimi K3:开放前沿智能
🔹 2.8万亿参数,100万上下文,原生多模态 🔹 Kimi Delta注意力机制在百万token上下文中实现高达6.3倍的解码加速 🔹 注意力残差带来约25%的训练效率提升,额外开销不足2%
相似文章
unsloth/Kimi-K3
Kimi K3 是一个开放权重的 2.8T 参数原生多模态代理模型,具有新颖的架构(KDA、AttnRes),1M 词元上下文,以及开源的 MoE 框架。
@svpino:我一直在测试Kimi K3,天哪,这是世界上见过的最好的开放权重模型。它是一个2.8T参数的…
Santiago Valdarrama 报道称,Kimi K3 是他测试过的最好的开放权重模型,一个2.8T参数的视觉模型,支持工具调用和推理,并拥有1M上下文窗口。
Kimi K3 架构概述与笔记
Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。
Kimi K3 如何通过工程创新跻身前沿 [R]
Moonshot 推出的 Kimi K3 是一款开放权重的模型,在 580 个模型中排名第四。其创新包括 Kimi Delta Attention(减少 KV 缓存内存)、Quantile Balancing(专家负载均衡)以及 AgentENV(高效 RL 训练沙盒)。
关于Kimi K3:其能力与相关不满(70分钟阅读)
Kimi K3是Moonshot AI推出的2.8T参数开放模型,基准测试表现强劲,但可能过度优化,且落后顶级闭源模型数月。它从Claude蒸馏而来,其发布可能先于IPO。