标签
本文介绍了ActFirst-OPD,一个通过将动作执行与完整推理解耦来加速多轮语言代理在线策略蒸馏的框架,在保持性能的同时实现了显著的训练加速。
本文比较了周期性物理信息神经网络中的傅里叶谱微分与空间自动微分,发现傅里叶方法在不损害准确性的前提下,显著加快了训练速度并减少了内存消耗。
本文研究了“小规模与大规模差距”,即与使用更大的数据集相比,在更少的样本上进行更多次重复训练可以带来更快的学习和计算节省,并将加速归因于采样偏差所实现的逐层增长。研究结果表明,带有重复的小数据集可以被主动利用作为有利的归纳偏置,尤其是在推理任务中。
一种新的训练方法通过允许模型在早期阶段更灵活地学习,实现了2-3倍的加速,类似于在家教育相对于工厂式教育的优势。
本文介绍了TwELL和Hybrid稀疏格式,配合自定义CUDA内核,有效利用LLM中的非结构化稀疏性,在H100 GPU上实现了训练和推理速度提升超过20%,同时降低了能耗和内存使用。