yarn-scaling

标签

Cards List
#yarn-scaling

(NInfer分支) 我为Qwen-3.8 27B在双5090显卡上实现1M上下文的尝试

Reddit r/LocalLLaMA · 20小时前

一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。

0 人收藏 0 人点赞
#yarn-scaling

Qwen 3.6 27B 在 262K 上下文以内表现稳定。使用 Rope/Yarn 缩放,你们最高达到了多少?

Reddit r/LocalLLaMA · 2026-07-16

用户分享了将 Qwen 3.6 27B 推至 262K 上下文并获得连贯结果的体验,并讨论了使用 Rope/Yarn 缩放进一步扩展的方法,以及在 RTX 3090 Ti 上的 kv-cache 交换策略。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈