标签
一项研究表明,通过在 44 个大语言模型间分配请求,可在 16 个基准测试(如 TerminalBench 和 LiveCodeBench)上减少 46% 的错误,从而优化性能。
本文提出REAL-Q,一种新颖的端到端对齐训练后量化方法,用于大语言模型,该方法利用动态梯度下降来减轻量化误差,在KL散度降低方面相较于最先进方法实现了显著改进。