mla

标签

Cards List
#mla

@AI_Whisper_X: 转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KD…

X AI KOLs Timeline ↗ · 2026-08-04 缓存

苏剑林对K3架构进行复盘,核心为KDA + MLA + Stable LatentMoE + AttnRes的组合,讲解其设计取舍、MoE稳定性改进、为何保留MLA,以及DSV4与MLA的关系。

0 人收藏 0 人点赞
#mla

超越KV重建:投机解码中MLA草稿模型的功能重构

arXiv cs.LG ↗ · 2026-07-31 缓存

本文提出功能重构方法,将MHA/GQA检查点转换为投机解码的MLA草稿模型,直接优化注意力模块以保留令牌接受率。报告在涉及Llama/Qwen模型和多种转换方法的192种配置中持续改进。

0 人收藏 0 人点赞
#mla

@classiclarryd: 向LLM研究社区提问:是否有人知道完全可重复的实验结果表明MLA能……

X AI KOLs Following ↗ · 2026-07-20 缓存

一位研究者质疑在相同KV缓存下MLA优于GQA的可重复性,分享了早期小规模消融实验结果,并计划进行规模扩展实验以决定下一次大规模运行的架构。

0 人收藏 0 人点赞
#mla

@IndieDevHailey: 22岁小伙两天逆推Anthropic黑箱!Claude Mythos架构彻底开源曝光 Anthropic放出史上最危险AI—Claude Mythos,能自主挖出操作系统和浏览器里藏了20多年的零日漏洞,只在Project Glasswi…

X AI KOLs Timeline ↗ · 2026-06-28 缓存

22岁开发者Kye Gomez仅用两天逆向Anthropic的Claude Mythos黑箱架构,并开源OpenMythos项目,采用循环深度Transformer等技术,770M参数实现相当于1.3B模型的性能。

0 人收藏 0 人点赞
#mla

@rasbt:总是回到基础:LatentMoE 可能受 MLA 启发,MLA 受 LoRA 启发,LoRA 受 SV…启发

X AI KOLs Timeline ↗ · 2026-06-09 缓存

Sebastian Raschka 指出,从 LatentMoE 到特征分解的灵感链:MLA、LoRA 和 SVD 层层启发。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈