Tag
A study demonstrates a 46% error reduction by routing requests across 44 LLMs, optimizing performance on 16 benchmarks like TerminalBench and LiveCodeBench.
The paper proposes REAL-Q, a novel end-to-end aligned post-training quantization method for large language models that uses dynamic gradient descent to mitigate quantization errors, achieving significant improvements in KL divergence reduction over state-of-the-art methods.