标签
用户在 2× DGX Spark 集群上测试了 Meta 的 Muse Glimmer 30B,使用 YaRN 将上下文从 131K 扩展到 1M tokens,并确认在 832K tokens 下通过检索。报告称 DFlash 投机解码带来了约 3 倍加速,并分享了完整配置。
Jet-Long提出了一种无需微调的零样本方法,通过动态调整RoPE缩放来扩展LLM上下文长度,在高达128K上下文的基准测试中取得了强劲性能,且推理开销极小。
EndPrompt 提出了一种方法,仅使用短训练序列即可扩展大语言模型的上下文窗口,通过将终端提示锚定到目标长度的位置索引。该方法在基准测试中取得了优异结果,且计算量远少于全长度微调。