我优化训练流水线的经验:从36步/分钟到47步/分钟
摘要
作者分享了将训练流水线性能从36步/分钟提升到47步/分钟的技术。
暂无内容
相似文章
并行化Transformer训练(39分钟阅读)
一个交互式、可探索的解释,介绍各种用于训练Transformer的并行化方案,改编自关于模型扩展的学术内容。
每月110美元的自优化流水线(5分钟阅读)
一位开发者分享了他们每月110美元的自动化流水线,该流水线使用Claude AI对GitHub issue进行分类、分解、实现和测试,在两周内完成了27次合并,且故障极少。
单次重写足矣:生产环境技能描述优化的经验教训
本文介绍了一个自动化管道,用于优化企业AI代理中的自然语言技能描述以解决技能冲突,其性能与手动调优相当,速度提升32倍。消融实验表明,使用错误案例的单次LLM重写即可捕获大部分改进,而其他设计选择影响甚微。
将本地代理转变为自我优化代理
一个自我优化的智能体管线,在TerminalBench上将基准性能从约30%提升至约90%,并且可以通过记录交互、使用本地模型进行反思、以及将经验注入未来的系统提示中,扩展应用到日常对话场景。
一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍
本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。