标签
用户分享了在运行MiniMax M2.7 REAP 139B Q3_K_L模型时,6块AMD MI50(96GB)与6块NVIDIA P40(144GB)的基准测试对比结果,显示P40在提示处理(prompt processing)方面更快,而MI50在令牌生成(token generation)方面更快。
报告在8-16张MI50 GPU上运行的Minimax M3模型达到每秒19个token的峰值吞吐量。
在 AMD MI50 GPU 上使用自定义 vllm 分支运行 Qwen 3.6 27B 的基准测试结果,实现了 52.8 tokens/s TG 和 1569 tokens/s PP,无量化或 MTP,证明了在 2018 年硬件上用于代理任务的可行性。