scaling

标签

Cards List
#scaling

Notion向量搜索两年回顾:规模扩大10倍,成本降至1/10

Lobsters Hottest · 2026-07-22 缓存

Notion分享了其向量搜索基础设施在过去两年中实现规模扩大10倍、成本降低90%的经验,详细介绍了从上线到处理数百万工作区的架构演变。

0 人收藏 0 人点赞
#scaling

多头注意力残差

Hugging Face Daily Papers · 2026-07-22 缓存

介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。

0 人收藏 0 人点赞
#scaling

NexForge:通过需求驱动任务合成扩展LLM的智能体能力

Hugging Face Daily Papers · 2026-07-21 缓存

NexForge是一个需求驱动的框架,能够为LLM后训练合成多样化、可执行的智能体任务和专家轨迹,优于先前的方法,并在Terminal-Bench上实现了最先进的开源智能体性能。

0 人收藏 0 人点赞
#scaling

AI最重要的协议变得更易用了

TechCrunch AI · 2026-07-20 缓存

模型上下文协议(MCP)正在更新,采用无状态方法,消除了会话ID管理问题,使其更容易在多个服务器上大规模运行,这可能会推动企业AI代理的采用。

0 人收藏 0 人点赞
#scaling

@phosphenq: 多智能体编码的秘密在一份15页的论文中揭晓:内聚感知任务划分将多智能体混乱...

X AI KOLs Timeline · 2026-07-20 缓存

一份15页的论文介绍了内聚感知任务划分,以改善多智能体编码的扩展性,概述了从提示到图的新元过程。

0 人收藏 0 人点赞
#scaling

@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…

X AI KOLs Timeline · 2026-07-20 缓存

研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。

0 人收藏 0 人点赞
#scaling

Xiaomi-Robotics-1

Hacker News Top · 2026-07-20 缓存

小米展示了Robotics-1,这是一个通过无实体预训练在10万小时数据上训练的机器人策略模型,展现出清晰的扩展行为和对真实世界任务的强大泛化能力。

0 人收藏 0 人点赞
#scaling

@qingke_ai: https://x.com/qingke_ai/status/2079035914740019638

X AI KOLs Timeline · 2026-07-20 缓存

本文以NVIDIA的Nemotron 3 Super和Moonshot AI的Kimi K3为例,分析了LatentMoE架构如何通过压缩Expert计算维度来解决传统MoE的效率瓶颈,并指出这是下一代MoE架构的转折点。

0 人收藏 0 人点赞
#scaling

@StartupArchive_: 本·霍罗威茨讲述马克·扎克伯格第二次解雇高管团队的故事 “第一次谈…

X AI KOLs Following · 2026-07-19 缓存

本·霍罗威茨讲述了马克·扎克伯格第二次解雇高管团队的事件,以及这如何促使他创建了Facebook的工程训练营,突显了扎克伯格对人和管理的深刻理解。

0 人收藏 0 人点赞
#scaling

理解从预训练到后训练的推理

Hugging Face Daily Papers · 2026-07-17 缓存

本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。

0 人收藏 0 人点赞
#scaling

Anthropic和OpenAI没有秘密配方

Reddit r/LocalLLaMA · 2026-07-16

一篇评论认为,Anthropic和OpenAI的优势在于规模而非秘密配方,随着参数量增加,DeepSeek V4和Kimi K3等开源模型正在迎头赶上。

0 人收藏 0 人点赞
#scaling

Kimi K3: 开放前沿智能

Reddit r/LocalLLaMA · 2026-07-16 缓存

Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。

0 人收藏 0 人点赞
#scaling

寻求合作者,用于扩展和独立评估一种新的循环语言模型架构(预印本+代码)[R]

Reddit r/MachineLearning · 2026-07-16

作者正在为一种新的循环语言模型架构的扩展和独立评估寻求合作者,并提供预印本和代码。

0 人收藏 0 人点赞
#scaling

@nrehiew_: > LatentMoE > 896个专家中激活16个 > Kimi Delta Attention 和 AttnRes > 2.5倍更高效的扩展 这是……

X AI KOLs Timeline · 2026-07-16 缓存

讨论具有极端稀疏性(16/896专家)的LatentMoE架构以及Kimi Delta Attention,声称有2.5倍更高效的扩展,并猜测Kimi K3模型的能力。

0 人收藏 0 人点赞
#scaling

让768台服务器看起来像1台

Hacker News Top · 2026-07-16 缓存

PlanetScale介绍了如何使用数据库分片将关系型数据库从单台服务器扩展到768台服务器,并解决诸如写入限制和资源争用等瓶颈问题。

0 人收藏 0 人点赞
#scaling

@nrehiew_: 给视觉学习者

X AI KOLs Timeline · 2026-07-16 缓存

一条推文描述了一个大型混合专家模型,总参数975B(活跃参数41B),在45T词元的多模态数据上训练而成,包含6个路由专家和2个共享专家,并与DeepSeek-V3进行了比较。

0 人收藏 0 人点赞
#scaling

xHC:扩展超连接

Hugging Face Daily Papers · 2026-07-16 缓存

本文介绍了xHC(扩展超连接),一种能够在Transformer中将残差流从原先的N=4限制有意义地扩展的方法,在18B和28B的MoE模型上取得了持续改进,且仅增加了适度的训练FLOPs。此外,还提出了xHC-Flash以减少内存流量,使得大型N残差流扩展在大语言模型预训练中变得实用。

0 人收藏 0 人点赞
#scaling

小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化

Hugging Face Daily Papers · 2026-07-16 缓存

小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。

0 人收藏 0 人点赞
#scaling

@rosinality: https://arxiv.org/abs/2607.12395 RL without SFT. 一个有趣的点是,他们能够使推理过程变得…

X AI KOLs Timeline · 2026-07-15 缓存

论文《Ring-Zero》提出了一种稳定的训练流程,将零强化学习(无需监督微调)扩展到1万亿参数,实现了涌现推理能力,如自我验证和结构化格式化,并在数学基准测试中表现出色。

0 人收藏 0 人点赞
#scaling

Ring-Zero: 将零强化学习扩展到万亿参数以实现涌现推理

arXiv cs.CL · 2026-07-15 缓存

Ring-Zero将带可验证奖励的强化学习扩展到万亿参数模型,展示了无需人工标注数据的涌现推理行为,如自我验证和结构化格式。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈