标签
PyTorch基金会将在PyTorch Conference North America 2026上举办Introduction Track和PyTorch Associate Training,以帮助开发者、研究人员和工程师提升深度学习和AI的技术技能。
本文提供了 Engram 模型的更新,详细介绍了其 2.6b 参数架构,包括一个大型 Engram 表和初步训练进度达到 1 亿 token,展示了通过上下文感知数据卸载实现的改进补全效果。
本文报告了在 Rust 中端到端训练语言模型的经验,详述了 Rust ML 框架如 Candle 和 Burn 中的失败案例,并提出了验证方法。结论是 Rust 目前更适合模型服务而非训练。
本文介绍了限制大规模MoE训练中四个关键内存峰值的方法,使得在1M上下文长度下使用固定GPU内存进行训练成为可能,并且相比基线,吞吐量提升高达10.4倍。
Kev 是一个基于 Qwen3.5 构建的小型决策模型系列,提供预训练权重和训练代码,适用于是/否、多选和评分问题。它包含一个网络试玩环境,并兼容 TypeSafe 的 System One API。
Kev 是基于 Qwen3.5 构建的小型决策模型家族,提供开源训练代码和预训练权重,支持本地部署,并兼容多种问题类型。
OpenAI 已扩展其 Academy,新增学习路径,面向开发者、领导者、教育工作者和大学生,帮助他们构建 AI 技能并在不同角色中有效应用 AI。
本研究探讨了语言模型训练中序列加权的缩放定律,发现模型随着规模增长表现出非单调行为:从学习通用模式转向学习数据特定模式,随后又回到通用模式。
Nathan Lambert 预测,顶尖的中国人工智能实验室越来越多地使用华为芯片进行推理,英伟达用于训练,这将随着智能体集群的兴起和规模化后训练而加速。
一篇关于在 PyTorch Conference North America 上演讲的公告,涵盖 Muon、Dion 和 Dion3 优化器在训练栈中的实际应用。
Modal的Runtime是仅限邀请的人工智能/机器学习会议,定于2026年10月1日在旧金山举行,涵盖推理、训练和智能体等主题,演讲者来自领先组织。
Linux Kernel Exploitation 即将发布的公告,提供折扣预订席位。
作者提供了关于构建一个小型20亿参数AI模型的更新,该模型具有Engram组件,在1500万维基百科tokens上训练,达到了惊人的连贯性,并计划进行Apache 2.0开源发布。
这篇文章反驳了AI发展正在放缓的观点,强调了Grok4.8,一个拥有2.5T参数的模型,已经完成训练,以及主要科技公司仍在积极训练AI模型。
一名宇航员回忆了着陆Space Shuttle Atlantis的刺激瞬间,详述了从Mach 1到着陆的无动力滑翔下降所需的严苛训练和精确度。
ZGCM-1是一个完全开源的7B大语言模型,从头训练,采用FP8、MDP中期训练和AI4AI,在数学和智能搜索任务上达到了与Qwen3-235B相当的性能。
Elon Musk宣布,Grok 4.8——一个采用新C++软件栈训练的2.5万亿参数AI模型——将于本周结束训练并启动强化学习。与此同时,@kentcdodds就Elon Musk提前讨论未来发展的习惯发表了评论。
本文将Transformer表示更新分解为平行和垂直分量,以研究演化几何,并将其与编辑鲁棒性、压缩诊断和训练改进联系起来。
Tahuna是一个开源的AI训练基础设施,专为小团队设计,用于训练模型、运行推理、编排GPU并进行自主研究实验,具有可重现的运行和如Hillclimb这样的工具。