双RTX 3090构建
摘要
一位用户分享其用于本地LLM推理的双RTX 3090构建,并寻求关于智能体工作及RAG流水线的工具栈建议。
加入这个社区重新点燃了我对软件工程的兴趣和爱好,这是我曾经失去的。于是我组装了这台双RTX 3090设备,主要用于推理。我知道短期内它无法取代ChatGPT,但什么样的工具栈能让它在工作环境中变得可用?必须使用MCP服务器或自定义工具/脚本吗?目前我在使用带有qwen3.6 27b的VScode预览版和一个nginx服务器。我主要对具有实用上下文的智能体工作感兴趣,或者至少对代码库有更好的理解(RAG流水线?)。这个社区一直非常有帮助,希望本地LLM继续发展,因为我担心云服务在消费层面会变得难以负担。
相似文章
从双3090升级 - 应该添加什么?(双A6000/5090/48GB 4090?)
关于从双RTX 3090升级到替代方案(如双A6000、RTX 5090或48GB RTX 4090)的讨论,可能用于AI/ML工作负载。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。
改装版RTX 4090 48GB vs Radeon AI Pro R9700 vs Arc Pro B70:本地编程LLM选哪个?
用户寻求关于在改装版RTX 4090 48GB、双AMD Radeon AI Pro R9700或双Intel Arc Pro B70之间选择的建议,用于运行本地编程LLM,重点比较价格、显存、软件生态和推理速度的权衡。
@TheAhmadOsman: 温馨提醒,开始使用本地AI所需的一切就是: - 2x RTX 3090(在r/hardwareswap上花$700-$900入手) -…
提醒一下,两块RTX 3090加上Qwen 3.6 27B或Gemma 4 31B等开源模型,就可以运行强大的本地AI代理,性能堪比Opus 4.5,配合Claude Code、自托管SearXNG等工具使用。
双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。
使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。