training

标签

Cards List
#training

@PyTorch:为支持开发者、研究人员和工程师深化技术技能,PyTorch基金会正在……

X AI KOLs Timeline ↗ · 11小时前 缓存

PyTorch基金会将在PyTorch Conference North America 2026上举办Introduction Track和PyTorch Associate Training,以帮助开发者、研究人员和工程师提升深度学习和AI的技术技能。

0 人收藏 0 人点赞
#training

Engram 疯狂!2b 模型更新...

Reddit r/LocalLLaMA ↗ · 2天前

本文提供了 Engram 模型的更新,详细介绍了其 2.6b 参数架构,包括一个大型 Engram 表和初步训练进度达到 1 亿 token,展示了通过上下文感知数据卸载实现的改进补全效果。

0 人收藏 0 人点赞
#training

Rust 中端到端训练语言模型:一份经验报告

arXiv cs.CL ↗ · 2天前 缓存

本文报告了在 Rust 中端到端训练语言模型的经验,详述了 Rust ML 框架如 Candle 和 Burn 中的失败案例,并提出了验证方法。结论是 Rust 目前更适合模型服务而非训练。

0 人收藏 0 人点赞
#training

将大规模MoE训练保持在固定GPU内存内(20分钟阅读)

TLDR AI ↗ · 2天前 缓存

本文介绍了限制大规模MoE训练中四个关键内存峰值的方法,使得在1M上下文长度下使用固定GPU内存进行训练成为可能,并且相比基线,吞吐量提升高达10.4倍。

0 人收藏 0 人点赞
#training

Kev (GitHub 仓库)

TLDR AI ↗ · 3天前 缓存

Kev 是一个基于 Qwen3.5 构建的小型决策模型系列,提供预训练权重和训练代码,适用于是/否、多选和评分问题。它包含一个网络试玩环境,并兼容 TypeSafe 的 System One API。

0 人收藏 0 人点赞
#training

DeepSeek 训练 2T 模型并规划 8T 模型

Reddit r/LocalLLaMA ↗ · 3天前

DeepSeek 正在训练一个 2 万亿参数的 AI 模型,并计划最终构建一个 8 万亿参数的模型。

0 人收藏 0 人点赞
#training

Kev:基于 Qwen3.5 的小型 Jev 风格决策模型家族

Hacker News Top ↗ · 4天前 缓存

Kev 是基于 Qwen3.5 构建的小型决策模型家族,提供开源训练代码和预训练权重,支持本地部署,并兼容多种问题类型。

0 人收藏 0 人点赞
#training

OpenAI Academy 扩展新学习路径

OpenAI Blog ↗ · 4天前 缓存

OpenAI 已扩展其 Academy,新增学习路径,面向开发者、领导者、教育工作者和大学生,帮助他们构建 AI 技能并在不同角色中有效应用 AI。

0 人收藏 0 人点赞
#training

序列加权的规模化研究

Lobsters Hottest ↗ · 4天前 缓存

本研究探讨了语言模型训练中序列加权的缩放定律,发现模型随着规模增长表现出非单调行为:从学习通用模式转向学习数据特定模式,随后又回到通用模式。

0 人收藏 0 人点赞
#training

@Suhail: https://x.com/Suhail/status/2101665324882075958

X AI KOLs Timeline ↗ · 4天前 缓存

Nathan Lambert 预测,顶尖的中国人工智能实验室越来越多地使用华为芯片进行推理,英伟达用于训练,这将随着智能体集群的兴起和规模化后训练而加速。

0 人收藏 0 人点赞
#training

@PyTorch:Muon 因快速收敛而备受关注,但让这些优化器在实际训练栈中工作却是另一项挑战…

X AI KOLs Timeline ↗ · 6天前 缓存

一篇关于在 PyTorch Conference North America 上演讲的公告,涵盖 Muon、Dion 和 Dion3 优化器在训练栈中的实际应用。

0 人收藏 0 人点赞
#training

@perilanglois: 访问 https://modal.com/runtime 看看这里的精彩内容

X AI KOLs Following ↗ · 2026-09-17 缓存

Modal的Runtime是仅限邀请的人工智能/机器学习会议,定于2026年10月1日在旧金山举行,涵盖推理、训练和智能体等主题,演讲者来自领先组织。

0 人收藏 0 人点赞
#training

@fuzzsociety_org: Linux Kernel Exploitation 即将发布,别忘了以折扣价预订席位

X AI KOLs Timeline ↗ · 2026-09-17 缓存

Linux Kernel Exploitation 即将发布的公告,提供折扣预订席位。

0 人收藏 0 人点赞
#training

更新:小模型 + Engram

Reddit r/LocalLLaMA ↗ · 2026-09-17

作者提供了关于构建一个小型20亿参数AI模型的更新,该模型具有Engram组件,在1500万维基百科tokens上训练,达到了惊人的连贯性,并计划进行Apache 2.0开源发布。

0 人收藏 0 人点赞
#training

@Kay2289123: 关于AI发展放缓的那个鬼故事——读一读,笑一笑,然后继续前行;别连自己都骗了。Grok4.…

X AI KOLs Timeline ↗ · 2026-09-16 缓存

这篇文章反驳了AI发展正在放缓的观点,强调了Grok4.8,一个拥有2.5T参数的模型,已经完成训练,以及主要科技公司仍在积极训练AI模型。

0 人收藏 0 人点赞
#training

航天飞机着陆——飞行器与毕生难忘的激动时刻

Hacker News Top ↗ · 2026-09-16 缓存

一名宇航员回忆了着陆Space Shuttle Atlantis的刺激瞬间,详述了从Mach 1到着陆的无动力滑翔下降所需的严苛训练和精确度。

0 人收藏 0 人点赞
#training

@HuggingPapers: ZGCM-1: 7B模型,前沿数学与搜索能力 一个完全开放的7B LLM,现已登陆Hugging Face。从头训练,采用FP…

X AI KOLs Timeline ↗ · 2026-09-15 缓存

ZGCM-1是一个完全开源的7B大语言模型,从头训练,采用FP8、MDP中期训练和AI4AI,在数学和智能搜索任务上达到了与Qwen3-235B相当的性能。

0 人收藏 0 人点赞
#training

@kentcdodds: 这家伙总是在我们还没拥有下一个东西之前就谈论下下个东西。

X AI KOLs Timeline ↗ · 2026-09-14 缓存

Elon Musk宣布,Grok 4.8——一个采用新C++软件栈训练的2.5万亿参数AI模型——将于本周结束训练并启动强化学习。与此同时,@kentcdodds就Elon Musk提前讨论未来发展的习惯发表了评论。

0 人收藏 0 人点赞
#training

通过方向分解解析Transformer中的表示演化

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

本文将Transformer表示更新分解为平行和垂直分量,以研究演化几何,并将其与编辑鲁棒性、压缩诊断和训练改进联系起来。

0 人收藏 0 人点赞
#training

踏准前沿 – Tahuna: AI训练基础设施,现已开源 [P]

Reddit r/MachineLearning ↗ · 2026-09-13

Tahuna是一个开源的AI训练基础设施,专为小团队设计,用于训练模型、运行推理、编排GPU并进行自主研究实验,具有可重现的运行和如Hillclimb这样的工具。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈