@no_stp_on_snek:mrcr v2 在 1m 长度下完成 8-needle 测试,采用开源权重堆栈,仅单台租赁 mi300x。longctx directional 0.688(n=30,mass-val 重跑待更新…
摘要
分享了一套开源模型堆栈在单卡 AMD MI300X 上运行的早期基准测试成绩与评估指标,表明其性能已具备与闭源方案竞争的实力。
查看缓存全文
缓存时间: 2026/05/09 03:40
mrcr v2,1m 规模下的 8-needle 测试,采用开源权重栈(open weights stack),使用单台租用的 mi300x。
longctx directional:0.688(n=30,mass-val 重跑 pending)。保守型 mass-val:0.601(n=60)。subq 已发布结果:0.659。
已非常接近达标,在 multiquery 设置下可能已通过。文中附有 Open 与 Closed 的对比记录。
相似文章
@no_stp_on_snek: https://x.com/no_stp_on_snek/status/2052833502475833384
使用 Qwen2.5-32B-Instruct 搭配 longctx 和 vllm-turboquant 的单个 AMD MI300X 开源技术栈,在 MRCR v2 百万级上下文基准测试中取得了与 SubQ 闭源模型(0.659)相竞争的结果(0.601-0.688),表明开源权重方法已接近达到同等水平。
@no_stp_on_snek: 长上下文实验的小更新:我在单个 MI300X droplet 上使用开源栈成功将 MRCR v2 运行到 1M 上下文长度。
作者报告成功在单个 MI300X 上使用 Qwen2.5-32B 和 FAISS 运行 MRCR v2,实现 1M 上下文长度,并以低成本获得有竞争力的分数。
@svpino:首次,我觉得开源权重模型已无法忽视。我们正处于这些模型具有竞争…
Santiago (@svpino) 强调 MiniMax-M2.7,一个 230B 参数的开源权重模型,能与 Opus 4.6 和 GPT-5.4 等顶级专有模型相抗衡,在 SambaNova 上以低成本实现 440+ tokens/s 的推理速度。
@no_stp_on_snek: 哇,看看 Metal 上的提升!!!
Qwen MLX 挑战赛是一项在 Apple Silicon 上对 AI 模型进行基准测试的比赛,鼓励在验证过程中提供官方分数并进行本地迭代。
@with_gene2626: 什么?397b nvfp4 是一个3或4 Spark配置……显示比所有当前开放权重模型更好的基准测试?有人……
Ornith-1.5,一个开源大语言模型家族,推出版本高达397B MoE,在同类模型中达到最先进的性能,并在基准测试中与Claude Opus相媲美。