GLM 5.3 与 GLM 5.3 Flash 在 RTX PRO 6000 WS 上本地运行,并通过 BlenderMCP 构建顶层公寓

Reddit r/LocalLLaMA 新闻

摘要

作者在 RTX PRO 6000 WS 硬件上本地运行 GLM 5.3 与 GLM 5.3 Flash 模型,并借助 BlenderMCP 在 Blender 中创建了一个3D顶层公寓场景,对比了两者的表现与准确性。

我经常看到通过 BlenderMCP 让 AI 代理在 Blender 中搭建场景的演示,所以自己尝试了一下。我为此本地运行了这两个模型,并选择了 GLM 5.3 系列(Q4 量化),因为它做3D工作的视频在我的 Twitter 信息流里频繁出现(出于好奇,我也用完整的 GLM 5.3 运行了相同提示词,同样是本地 Q4 量化)。这些显然不是小模型:一个4比特量化的 Flash 大约需要 190-200GB 内存,加上上下文占用的额外空间。完整的 GLM 5.3 在4比特量化下大约需要 450-470GB(基本上,我为两者都选择了 Q4 量化和 RTX PRO 6000 WS GPU,不过对于 Flash 模型我租用了 4 块 RTX PRO 6000 WS,而基础模型则租用了 6 块)。撰写提示词并不像我想的那么容易。我最初的尝试很模糊,生成的大多是3D“糊状物”而不是一个真正的房间。最终我开始指定真实尺寸:层高、楼梯踏步高度、窗框间距等等(镜头运动由 Claude Opus 5 单独完成,这样我的 token 统计不会因此膨胀)。提示词内容:在打开的 Blender 会话中建模一个豪华复式顶层公寓。占地面积 20.0 x 13.0 米(260 平方米)。主层高 2.9 米。一个 9.0 x 8.0 米的双层挑高区域,高度达 6.2 米。夹层位于 3.1 米处,带有 1.1 米的栏杆。楼梯:17 级踏步,踏步高 0.182 米,踏步深 0.28 米。露台 20.0 x 4.5 米,位于 Z = -0.02 处,栏杆高 1.15 米。玻璃幕墙,竖框间距 1.5 米,框深 0.06 米。门高 2.10 米。台面高 0.90 米。餐桌高 0.74 米。沙发座面高 0.42 米。材质 PBR 范围:玻璃折射率 1.45-1.52,透射度 1.0;混凝土粗糙度 0.25-0.40;大理石粗糙度 0.08-0.15;拉丝金属金属度 1.0,粗糙度 0.25-0.35;织物粗糙度 0.75-0.95。参考真实顶层公寓的比例。进行室内布置。不要添加摄像机。不要重置会话。起初它搭建了幕墙、楼梯、夹层、玻璃栏杆等,后来我注意到它也用一些家具布置了空间:沙发、餐桌以及桌上的餐盘。吊灯从4米长的电线上垂下,而且不知为何它还建模了书本的单根书脊,这是我从未要求的。视频只跟拍了客厅空间的镜头,因此露台和外立面不可见(这个片段是从我用相同场景制作的另一个视频中重用的,我没有重新渲染,因为那相当耗时)。数据指标 Flash GLM 5.3 对象数 811 847 交互轮次 43 42 工具错误 9 8 第一个对象前的思考时间 10秒 21分55秒 总时间 38分52秒 40分43秒 输出 token 36K 112K。GLM 5.3 在放置任何对象之前花了22分钟思考(82k token),并且生成的对象比 GLM 5.3 Flash 多36个,消耗的输出 token 多出3倍。而 GLM 5.3 Flash 几乎立即开始工作。我事后通过从地板向上进行光线投射并对照简报检查房间来测量两个场景。Flash 将双层挑空区域正确建模为 9 x 8 米。而完整模型将其建模为 9 x 4.5 米,却报告为 9 x 8 米。这显然只是一个实验,不是基准测试。Flash 在对象数量和总时间上出人意料地接近,同时使用的输出 token 不到三分之一。当完整模型出错时,它还正确获取了主房间尺寸。如果你想尝试相同的 Blender 设置,我使用的是社区的 BlenderMCP 项目。我是 atomic.chat 的创始人,我们有一个用于运行本地模型的应用程序以及我们自己的量化版本(欢迎任何反馈,我们正在努力让我们的产品尽可能为你们做好)。
查看原文

相似文章