标签
阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。
字节跳动正在早期阶段训练一个参数多达10万亿的大语言模型,标志着AI开发的大规模扩展。
LG AI Research presents K-EXAONE 2.0, a 750B-parameter MoE foundation model upcycled from K-EXAONE, supporting 256K context and six languages, with self-speculative decoding for efficient inference.
本文介绍了一种使用Qwen3-8B的激活引导神经元干预框架,用于诱导阿尔茨海默病相关的计算语言表型,证明放大与AD相关的神经元会在多个认知领域产生分级损伤。
Qwen宣布,拥有2.4万亿参数的Qwen3.8-Max将于下周以开放权重的方式发布,同时发布的还有Qwen3.8-27B,这标志着开源AI的一次重大推进,并可能使其与顶级专有模型一较高下。
本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。
Kimi K3是一个庞大的2.9万亿参数混合专家模型,拥有1040亿活跃参数,100万上下文长度,原生支持MXFP4训练,现已提供从540GB到更小尺寸的GGUF量化版本,但运行需要强大的硬件。
SKT 在 Hugging Face 上发布了 A.X K2,一个 688B 参数的稀疏 MoE 语言模型,拥有 33B 激活参数,原生采用 FP8 训练,并具备 Think/Non-Think 推理模式。
埃隆·马斯克宣布Grok 4.6将于8月7日左右发布,这是一个1.5T参数的模型,经过改进的SFT和RL;随后几周将发布更好的Grok 4.7(2.1T参数)。
Elon Musk宣布,Grok 4.6将于8月7日左右发布,采用1.5T参数模型并改进了SFT与RL,随后将推出2.1T参数的Grok 4.7。
Moonshot AI releases Kimi K3, a 2.8 trillion parameter open-weight MoE model with native multimodal capabilities and a 1 million token context window, claiming it as the world's first open 3T-class model.
Kimi Moonshot 发布了 Kimi K3,这是一个 2.8 万亿参数的多模态模型,拥有 100 万 token 的上下文窗口,以及 Kimi Delta Attention 和 Attention Residuals 等架构创新。公司声称其效率显著提升,在内部基准测试中超越了 Claude Opus 4.8 和 GPT-5.5。
Moonshot发布了他们的2.8万亿参数模型Kimi K3的权重,采用了一种修改后的许可证,要求大型商业Model-as-a-Service企业另行签订协议。
Kimi K3 是 Moonshot AI 推出的 2.8 万亿参数的开源模型,支持 100 万 token 上下文和原生视觉能力,现已上线 Telnyx Inference API,适用于编码、推理和多模态等任务。
MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。
Kimi.ai 发布了 Kimi K3 的模型权重和技术报告,这是一个 2.8T 参数的 MoE 模型,具有原生视觉理解和 1M token 上下文窗口,声称每单位计算智能提升 2.5 倍。
Macaron V1 发布两个变体:Venti(748B 旗舰,配备 4×1B LoRA 专家)和 Tall(50B 本地部署,配备 4×3.7B LoRA 专家),分别基于 GLM-5.2 和 Qwen 3.6 进行后训练。
Moonshot 发布了最大的开源权重模型 Kimi K3(2.8 万亿参数),拥有出色的基准测试成绩,但自托管需要巨大硬件,对大多数用户而言,API 接入是更实际的选择。
Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。