标签
一位开发者创建了一个密集的9.4B参数AI模型,具有Engram表和AttnRes建模等技术增强,旨在开源发布,并寻求社区兴趣以进行进一步训练和部署。
本文介绍了管理长上下文长度下训练大型混合专家模型内存峰值的技术,包括Pipelined LLEP、Ring-DTP、SCO和OffloadStreamAdamW,这些技术实现了固定的GPU工作集,并将吞吐量提高了多达10.4倍。
文章揭示,由于推理令牌未被归类为用户拥有的输出这一漏洞,OpenAI 的条款允许其使用付费用户的交互进行训练,尽管存在退出选项。
作者正在实验用于PyTorch的自适应内存管理器,以防止8GB GPU上的CUDA内存溢出错误,分享代码并寻求社区反馈。
一个实验,其中两个分割模型使用GPT-6 Astra Ultra作为编排器进行训练,未使用人工标签,由于时间限制提示较为随意,并展示了在保留视频上的预测结果。
4000块NVIDIA GB200 GPU已抵达Texas,用于Horizon TACC集群,形成了最大的学术超级计算机,并计划训练开源AI模型。
一个轻量级的TTS实现,通过2000小时数据复现Audio8的训练,在H200上不到10小时训练就达到了0.72的SIM指标。
这是一本大幅修订的机器学习工程开放书籍,已更新至最新的硬件规格和示例,为训练和微调大语言模型及多模态模型提供实用指南。
本文介绍了如何使用 Sentence Transformers 库训练和微调多向量嵌入模型,展示了其 v6.0 更新中的新 MultiVectorEncoder 类型,并在医疗检索任务中演示了其卓越的性能。
本文探讨一门高价课程,旨在帮助人们准备尚未完全定义的新兴AI职位,突显了AI就业市场中日益增长的需求和不确定性。
Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。
Runtime by Modal 是一场面向AI和ML工程师的会议活动,旨在讨论在生产环境中运行AI,包括关于推理、训练和代理的演讲。
Matt Pocock 分享了一封模板信,帮助开发者说服老板投资他的 AI Hero 课程,该课程教授使用 AI 编程助手进行高效结构化工程流程。
一条推文宣布了535B参数(23B活跃)大语言模型的实时训练,并提供了在Weights & Biases和GitHub上跟踪进程的链接。
一项实验使用相同的GRPO配方训练三个从头开始的LLM,得到了不一致的结果,GRPO在某些模型中降低了性能,特别是中等规模的那个,并且与规模没有明显的关系。
LEGO-RL 提出了一种框架,将原生编码代理的执行环境与可扩展的策略梯度强化学习相结合,从而提升在 SWE-bench 等基准测试上的性能。
本文探讨了训练浏览器代理模型进行顺序决策时的挑战,如错误恢复和记忆问题,并寻求优化训练目标的建议。作者提到了在tinyfish开发的'mako'模型,并邀请社区反馈。