我搭建了一台配备768GB显存的服务器用于前沿AI,但所有新的前沿开源模型现在可能都达到两万亿参数或以上,包括下一代GLM 6,我该怎么办?
摘要
一位个人讨论了搭建一台配备768GB显存的服务器来运行前沿AI模型,但担心像GLM6这样的新开源模型变得太大,促使考虑转向更小的flash模型。
我使用的这台EPYC服务器配备了12张64GB显存的卡,加上256GB内存。纵观开源中最强大的模型,GLM 5.3似乎是唯一的选择,但随着Astra的发布,它可能会落后很多。GLM6看起来大小至少翻倍,甚至可能三倍。Qwen-max和Kimmi已经大到根本无法考虑。即使是deepseek V4 Pro也太大。我是否应该放弃这个前沿梦想,卖掉多余的GPU,转而使用更少的GPU和合理成本的flash模型。注意:我不用于任何商业用途。我原本希望通过这个建立新业务,但使用flash模型可能也能做到,只是需要更多努力。编辑:我不想使用低于4位的量化,因为那样模型会开始犯明显的错误。所以我指的是4位量化作为最小/最大值。好了,这个帖子真的火了。没想到会有这么多兴趣或评论只是攻击我。原本只是期望能平静地讨论未来SOTA模型的大小。
相似文章
12GB显存的小伙伴们,我们的计划是什么?
讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。
是否有针对192 GB内存的GLM 5.3 Flash Antirez/DS4 GGUF模型?
作者询问是否存在适合192 GB内存的GLM 5.3 Flash Antirez/DS4 GGUF模型,并希望得到构建此类模型的建议。
高显存本地编码模型——依然首选 Qwen 3.6 27B 吗?
用户分享了使用 Qwen 3.6 27B 进行本地编码任务的经验,并寻求适合拥有 224GB 显存系统的更大模型(100B 以上)的推荐。
2026年第二季度,在3x3090(72GB显存)配置上最好的模型?
用户分享了在2026年第二季度使用3x3090(72GB显存)配置运行大型LLM的经验,推荐了GPT-OSS 120b、Qwen3.5 122b和GLM Air 4.5 106B等模型,并询问是否有更新的替代方案。
这里有多少人拥有24GB以上的GPU?
作者基于下载次数讨论了qwen 3.8 27b模型的低采用率,并估计很少有用户拥有用于高效本地LLM开发的高显存GPU。