我搭建了一台配备768GB显存的服务器用于前沿AI,但所有新的前沿开源模型现在可能都达到两万亿参数或以上,包括下一代GLM 6,我该怎么办?

Reddit r/LocalLLaMA 新闻

摘要

一位个人讨论了搭建一台配备768GB显存的服务器来运行前沿AI模型,但担心像GLM6这样的新开源模型变得太大,促使考虑转向更小的flash模型。

我使用的这台EPYC服务器配备了12张64GB显存的卡,加上256GB内存。纵观开源中最强大的模型,GLM 5.3似乎是唯一的选择,但随着Astra的发布,它可能会落后很多。GLM6看起来大小至少翻倍,甚至可能三倍。Qwen-max和Kimmi已经大到根本无法考虑。即使是deepseek V4 Pro也太大。我是否应该放弃这个前沿梦想,卖掉多余的GPU,转而使用更少的GPU和合理成本的flash模型。注意:我不用于任何商业用途。我原本希望通过这个建立新业务,但使用flash模型可能也能做到,只是需要更多努力。编辑:我不想使用低于4位的量化,因为那样模型会开始犯明显的错误。所以我指的是4位量化作为最小/最大值。好了,这个帖子真的火了。没想到会有这么多兴趣或评论只是攻击我。原本只是期望能平静地讨论未来SOTA模型的大小。
查看原文

相似文章