标签
探讨双RTX 5060 Ti GPU在运行Qwen 27B等大型LLM时利用率仅达50%左右的原因:内存带宽是瓶颈,逐层拆分导致空闲时间,这更像是接力赛而非并行计算。
QSplitFL提出了一种基于DQN的框架,用于在分割联邦学习中选择最优分割点,利用客户端硬件指标适应异构设备。实验表明,在多个数据集和架构上,该方法提高了收敛速度和准确率。