标签
Notion分享了其向量搜索基础设施在过去两年中实现规模扩大10倍、成本降低90%的经验,详细介绍了从上线到处理数百万工作区的架构演变。
介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。
NexForge是一个需求驱动的框架,能够为LLM后训练合成多样化、可执行的智能体任务和专家轨迹,优于先前的方法,并在Terminal-Bench上实现了最先进的开源智能体性能。
模型上下文协议(MCP)正在更新,采用无状态方法,消除了会话ID管理问题,使其更容易在多个服务器上大规模运行,这可能会推动企业AI代理的采用。
一份15页的论文介绍了内聚感知任务划分,以改善多智能体编码的扩展性,概述了从提示到图的新元过程。
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。
小米展示了Robotics-1,这是一个通过无实体预训练在10万小时数据上训练的机器人策略模型,展现出清晰的扩展行为和对真实世界任务的强大泛化能力。
本文以NVIDIA的Nemotron 3 Super和Moonshot AI的Kimi K3为例,分析了LatentMoE架构如何通过压缩Expert计算维度来解决传统MoE的效率瓶颈,并指出这是下一代MoE架构的转折点。
本·霍罗威茨讲述了马克·扎克伯格第二次解雇高管团队的事件,以及这如何促使他创建了Facebook的工程训练营,突显了扎克伯格对人和管理的深刻理解。
本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。
一篇评论认为,Anthropic和OpenAI的优势在于规模而非秘密配方,随着参数量增加,DeepSeek V4和Kimi K3等开源模型正在迎头赶上。
Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。
作者正在为一种新的循环语言模型架构的扩展和独立评估寻求合作者,并提供预印本和代码。
讨论具有极端稀疏性(16/896专家)的LatentMoE架构以及Kimi Delta Attention,声称有2.5倍更高效的扩展,并猜测Kimi K3模型的能力。
PlanetScale介绍了如何使用数据库分片将关系型数据库从单台服务器扩展到768台服务器,并解决诸如写入限制和资源争用等瓶颈问题。
一条推文描述了一个大型混合专家模型,总参数975B(活跃参数41B),在45T词元的多模态数据上训练而成,包含6个路由专家和2个共享专家,并与DeepSeek-V3进行了比较。
本文介绍了xHC(扩展超连接),一种能够在Transformer中将残差流从原先的N=4限制有意义地扩展的方法,在18B和28B的MoE模型上取得了持续改进,且仅增加了适度的训练FLOPs。此外,还提出了xHC-Flash以减少内存流量,使得大型N残差流扩展在大语言模型预训练中变得实用。
小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。
论文《Ring-Zero》提出了一种稳定的训练流程,将零强化学习(无需监督微调)扩展到1万亿参数,实现了涌现推理能力,如自我验证和结构化格式化,并在数学基准测试中表现出色。
Ring-Zero将带可验证奖励的强化学习扩展到万亿参数模型,展示了无需人工标注数据的涌现推理行为,如自我验证和结构化格式。