标签
本文探讨一门高价课程,旨在帮助人们准备尚未完全定义的新兴AI职位,突显了AI就业市场中日益增长的需求和不确定性。
Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。
Runtime by Modal 是一场面向AI和ML工程师的会议活动,旨在讨论在生产环境中运行AI,包括关于推理、训练和代理的演讲。
Matt Pocock 分享了一封模板信,帮助开发者说服老板投资他的 AI Hero 课程,该课程教授使用 AI 编程助手进行高效结构化工程流程。
一条推文宣布了535B参数(23B活跃)大语言模型的实时训练,并提供了在Weights & Biases和GitHub上跟踪进程的链接。
一项实验使用相同的GRPO配方训练三个从头开始的LLM,得到了不一致的结果,GRPO在某些模型中降低了性能,特别是中等规模的那个,并且与规模没有明显的关系。
LEGO-RL 提出了一种框架,将原生编码代理的执行环境与可扩展的策略梯度强化学习相结合,从而提升在 SWE-bench 等基准测试上的性能。
本文探讨了训练浏览器代理模型进行顺序决策时的挑战,如错误恢复和记忆问题,并寻求优化训练目标的建议。作者提到了在tinyfish开发的'mako'模型,并邀请社区反馈。
下一届为期8周的AI工程训练营报名已开放,专注于RAG & Agents,面向提升技能转向AI岗位的软件工程师。
介绍“Training Under Challenge”(挑战下训练),这是一个可执行证书框架,利用架构有效的过程构建替代模型,并估计神经网络检查点的经验全局最优性差距,具有理论保证以及基于 ResNet-18 蒸馏和量化去噪的实验。
安德烈·卡帕西从零开始构建了一个LLM,并开源了所有代码,涵盖了数据集、训练循环和推理循环的完整流水线,延续了他通过micrograd和makemore简化AI教育的工作。
作者讨论了一篇论文,该论文揭示了OPD(可能是在线策略蒸馏)的预热过程,解释了预热如何使学生采样的序列定义良好,并使来自教师的token级密集奖励具有教育意义。
This paper proposes an adaptive supervised anchoring framework for on-policy self-distillation, addressing the problem of rollout-conditioned signal degradation in language model training. The method separates rollout-conditioned distribution matching from canonical-context supervision, improving task acquisition while preserving general capabilities.
Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。
据报道,Pathway的BDH(一种后Transformer架构)在标准GPU上从零训练时,在10M到1B参数范围内匹配GPT-2的缩放性能。
Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。
特斯拉欧洲宣布,FSD Supervised 已在19个欧盟国家进行了220万公里的训练和测试,处理了罕见的边缘情况。
Gregory Kurtzer称赞Lucas Atkins的演讲,内容涉及训练大型稀疏混合专家模型的经验教训,以及AI实验室初创公司的生活。
据金融时报报道,字节跳动正在训练一个估算参数量达10万亿级别的AI大模型,规模接近Anthropic的先进系统,旨在缩小与美国顶级AI实验室的差距。